任意域名
查找适用于任何公开网站的专用和通用 Oxylabs 网页爬虫API 指南。
探索我们专为以下内容提供的网页爬虫API抓取源: 电商网站, 搜索引擎, LLM 与 AI, 视频数据, 房地产 平台,或使用我们的 universal 源,使用以下指南。它接受 URL 以及 附加参数.
请求示例
在此示例中,API 将获取一个电商产品页面。
curl 'https://realtime.oxylabs.io/v1/queries' \\
--user 'USERNAME:PASSWORD' \\
-H 'Content-Type: application/json' \\
-d '{
"source": "universal",
"url": "https://sandbox.oxylabs.io/products/1"
}'import requests
from pprint import pprint
# 结构化载荷。
payload = {
'source': 'universal',
'url': 'https://sandbox.oxylabs.io/products/1',
}
# 获取响应。
response = requests.request(
'POST',
'https://realtime.oxylabs.io/v1/queries',
auth=('USERNAME', 'PASSWORD'),
json=payload,
)
# 不会返回包含作业状态和结果 url 的响应,而是返回
# 包含结果的 JSON 响应。
pprint(response.json())我们在示例中使用同步 Realtime 集成方法。如果您想使用 Proxy Endpoint 或异步 Push-Pull 集成,请参阅 集成方法 部分。
请求参数值
通用
- 必填参数
附加
以下是我们的 功能的参数.
解析
设置为以下值时返回解析后的数据: true,前提是所提交 URL 的页面类型有专用解析器。
false
context:
session_id
如果您希望在多个请求中使用同一代理,可以使用此参数。只需将会话设置为任意字符串,我们将为此 ID 分配一个代理,并保留最长 10 分钟。之后,如果您使用相同的会话 ID 再次发起请求,将为该会话 ID 分配一个新代理。
-
context:
content
经过 Base64 编码的 POST 请求正文。仅当 http_method 设置为 post.
-
context:
follow_redirects
设置为 true 以启用爬虫跟随重定向。默认情况下,最多跟随 10 个链接的重定向,并将整个链视为一个抓取任务。
true
context:
successful_status_codes
定义一个或多个自定义 HTTP 响应代码,出现这些代码时我们将视为抓取成功并向您返回内容。如果您希望我们返回 503 错误页面,或在其他非标准情况下,这可能会很有用。
-
所有参数
在此示例中,包含了所有可用参数(尽管它们并非总是必需,也不一定能在同一请求中兼容),以便您了解如何设置请求格式。
最后更新于
这有帮助吗?

