For the complete documentation index, see llms.txt. This page is also available as Markdown.

快速上手:网页爬虫API

通过简单的分步指南,只需几分钟即可开始使用 Oxylabs 网页爬虫API。

Oxylabs 网页爬虫API 是一体化解决方案,可自动处理代理轮换、JavaScript 渲染和反爬虫系统。本指南将带你在几分钟内从空终端走到实时网页数据。

请按照以下详细步骤操作,或观看一个简短的视频演示:

1

设置与凭据

在发送第一请求前,你需要授权访问:

  1. 创建账户: 在以下位置注册: Oxylabs 仪表板.

  2. 选择套餐: 选择免费试用进行测试,或立即订阅。

  3. 创建 API 用户: 前往左侧的“网页爬虫API”部分,并选择“用户”选项卡。

  4. 保存你的凭据: 所有请求都需要这些特定的 API 凭据(不是你的仪表板登录信息)。

2

你的首次请求

通用 来源适用于任何公开网站。打开你的终端并运行此命令以抓取我们的沙盒站点:

3

获取结构化数据

如果你正在抓取受支持的域名(如 Amazon 或 Google),API 可以返回结构化 JSON,而不是原始 HTML。只需将 source 设置为专用目标并使用 "parse": true。例如,让我们抓取一个 Amazon 商品:

核心参数

以下是用于自定义请求的最常用参数:

参数
类型
描述

source

字符串

必填。抓取引擎(例如 Amazon、Google 等)。 通用, Amazon, Google等)。

url / query

字符串

目标链接,或专用目标的关键词/ID。

parse

布尔值

设置为 true 以在受支持的域名上获得结构化 JSON 结果。

render

字符串

设置为 html 用于为 JavaScript 密集型网站启用无头浏览器。

geo_location

字符串

本地化你的结果(例如, 美国90210).

你可以在网页爬虫API 文档API 目标 部分。

常见响应代码

代码
状态
描述

200

成功

成功。你的数据位于 results 对象。

401

未授权

检查你在仪表板中的 API 用户凭据。

429

请求过多

你已超出并发限制。

你可以找到 完整的响应代码列表 在网页爬虫API产品部分。

下一步

既然你已经发送了第一个查询,请根据你的需求继续浏览其余文档:

  • 在寻找特定域名? 前往 API 目标 部分,查看 Amazon、Google、eBay 以及更多热门网站的专用指南。

  • 需要高级功能? 访问 产品 版块,了解自定义解析、任务管家、云存储传输等更多内容。

  • 借助 AI 规模化? 查看 面向 AI 工作流的解决方案 或了解 OxyCopilot 如何用自然语言自动化你的解析逻辑。

  • 其他集成方式? 我们的示例使用同步 Realtime 集成。你可以在 集成方式 页面。

最后更新于

这有帮助吗?