For the complete documentation index, see llms.txt. This page is also available as Markdown.

快速入门:网页爬虫API

已经熟悉基础内容?查看 网页爬虫API 文档 或者使用我们便捷的 集成中心.

Oxylabs 网页爬虫API 是一个一体化解决方案,可自动处理代理轮换、JavaScript 渲染和反机器人系统。本指南将带你在几分钟内从空白终端到获取实时网页数据。

按照以下详细步骤操作,或观看简短视频演示:

1

设置与凭据

在发送第一条请求之前,你需要先授权访问:

  1. 创建账户: 在以下位置注册: Oxylabs 仪表板.

  2. 选择套餐: 选择免费试用进行测试,或立即订阅。

  3. 创建 API 用户: 在左侧进入“网页爬虫API”部分,然后选择“用户”标签页。

  4. 保存你的凭据: 所有请求都需要这些特定的 API 凭据(不是你的仪表板登录信息)。

2

你的第一条请求

通用 source 可用于任何公开网站。打开你的终端并运行此命令来抓取我们的沙盒站点:

3

获取结构化数据

如果你正在抓取受支持的域名(例如 Amazon 或 Google),API 可以返回结构化 JSON,而不是原始 HTML。只需将 source 设置为专用目标,并使用 "parse": true。例如,让我们抓取一个 Amazon 商品:

核心参数

以下是用于自定义请求的最常用参数:

参数
类型
说明

source

字符串

必填。抓取引擎(例如, 通用, amazon, google等)。

url / query

字符串

目标链接,或专用目标的关键词/ID。

parse

布尔值

设置为 true 以在受支持的域名上返回结构化 JSON 结果。

render

字符串

设置为 html 以为 JavaScript 内容较多的网站启用无头浏览器。

geo_location

字符串

本地化结果(例如, 美国90210).

你可以在网页爬虫API 文档API 目标 部分中找到更多可自定义的参数。

常见响应代码

代码
状态
说明

200

成功

成功。你的数据在 results 对象中。

401

未授权

请检查仪表板中的 API 用户凭据。

429

请求过多

你已超出并发限制。

你可以找到 完整响应代码列表 在网页爬虫API产品部分。

下一步

既然你已经发送了第一条查询,就根据你的需求继续浏览我们的其余文档:

  • 在寻找特定域名吗? 前往 API 目标 部分,查看 Amazon、Google、eBay 以及更多热门网站的专用指南。

  • 需要高级功能吗? 访问 产品 空间,了解自定义解析、任务管家、云存储交付等更多内容。

  • 通过 AI 扩展规模? 查看 适用于 AI 工作流的解决方案 或者了解 OxyCopilot 如何使用自然语言自动化你的解析逻辑。

  • 不同的集成方式? 我们的示例使用同步 Realtime 集成。你可以在 集成方法 页面中找到 Proxy Endpoint 或异步 Push-Pull 集成。

最后更新于

这有帮助吗?