网页爬虫API
学习使用网页爬虫API抓取你需要的任何公开网站。查找代码示例、参数用法、定位等更多内容。
网页爬虫API 是一个 一体化网页数据收集解决方案 专为从任意公开网站大规模提取实时数据而设计。它覆盖网页抓取的每个阶段,从爬取 URL 和提高访问成功率,到数据解析并交付到你偏好的存储中,因此你无需管理代理、请求管理或基础设施。
该工具旨在符合企业安全标准,包括 SOC 2 Type II 合规,并提供可快速适应的基础设施,可动态调整以匹配目标网站,确保在搜索引擎、电商网站、旅行平台等场景下都具有高成功率和可靠的数据提取。
入门指南
创建你的 API 用户凭据:注册免费试用或在 Oxylabs 控制台 以创建你的 API 用户凭据(USERNAME 和 PASSWORD).
请求示例
该 API 会作为其集成基础设施的一部分自动管理代理轮换、请求重试,并自动处理机器人监测系统,因此一次请求即可获取所有结构化数据。
curl 'https://realtime.oxylabs.io/v1/queries' \\
--user "USERNAME:PASSWORD" \\
-H "Content-Type: application/json" \\
-d '{
"source": "amazon_product",
"query": "B07FZ8S74R",
"geo_location": "90210",
"parse": true
}'curl 'https://realtime.oxylabs.io/v1/queries' \\
--user 'USERNAME:PASSWORD' \\
-H 'Content-Type: application/json' \
-d '{
"source": "google_search",
"query": "adidas",
"geo_location": "California,United States",
"parse": true
}'curl 'https://realtime.oxylabs.io/v1/queries' \\
--user 'USERNAME:PASSWORD' \\
-H 'Content-Type: application/json' \
-d '{
"source": "universal",
"url": "https://sandbox.oxylabs.io/"
}'我们在示例中使用同步 Realtime 集成方式。如果你想使用 Proxy Endpoint 或异步 Push-Pull 集成,请参阅 集成方式 部分。
请求参数值
source- 该参数用于设置处理你的请求所使用的抓取器。URL还是query- 提供URL还是query用于你想抓取的页面类型。请参阅下表及相应目标子页面,了解各参数的详细使用指南。
- 必填参数
使用 URL 或参数化输入进行抓取
Oxylabs 支持两类通用输入——URL 和参数化输入,例如查询、产品或视频 ID。 通用目标 没有专用 source 的目标可以使用 universal source。
google
google_search,
google_ads,
google_ai_mode,
google_lens,
google_maps,
google_travel_hotels,
google_trends_explore,
google_shopping_product,
google_shopping_search
universal
youtube_search,
youtube_search_max,
youtube_video_trainability,
youtube_download,
youtube_subtitles,
youtube_metadata,
youtube_channel,
youtube_autocomplete
通过 Web Scraper API Playground 进行测试
通过 Postman 进行测试
使用 Postman 开始使用我们的 API,这是一个用于发起 HTTP 请求的便捷工具。下载我们的 网页爬虫API Postman 集合 并导入它。此集合包含演示爬虫功能的示例。可根据需要自定义这些示例,或立即开始爬取。
如需逐步说明,请观看下方的视频教程。如果你是 Postman 新手,请查看这个简短的 指南.
最后更新于
这有帮助吗?

