For the complete documentation index, see llms.txt. This page is also available as Markdown.

更新日志

跟踪 Oxylabs 的最新产品更新、功能发布和改进。及时了解我们的工具和文档中的新内容。

Google Travel:酒店的细粒度解析结果

google_travel_hotels source 现在会在以下情况下返回更详细的 offers 字段: parse 设置为 true,且每个解析后的响应中都会包含额外的酒店优惠详情。

增强 Google 搜索新闻的解析

来自 google_search source 的解析输出现在通过使用以下设置,为附加新闻组件返回更详细的数据: "parse": true ,该组件会显示在使用以下参数的搜索中: tbm=nws 参数。

提高无头浏览器的会话一致性

无头浏览器 会话已得到改进,在访问目标网站时能保持更高的一致性,而不会在请求之间重新生成。

Google Books 专用解析器

专用的 Google Books 解析器 现已可通过 google_search source 使用以下参数 tbm=bks 并将 parse 设置为 true ,以接收 JSON 格式的结构化图书数据。

YouTube Downloader 音频参数

YouTube Downloader 现在接受可选的 audio_language 参数,用于选择音轨:

  • original – 创作者的原始音轨

  • default – YouTube 选择的音轨(可能为配音)。

新增代理地点

多个自助式代理产品新增了地点:

提高 Google AI Mode 的提示词限制

以下请求的最大提示词长度: Google AI Mode 源请求已增加 从 4,000 个字符增至 8,000 个字符.

适用于 LLM 源的自定义浏览器指令

LLM 源 现已支持 自定义浏览器指令,让您可以定义操作(例如点击、滚动、等待),以在提取内容前控制页面行为。

适用于 Home Depot 数据的自定义解析器

一个 专用解析器 现已可通过以下方式用于 Home Depot 产品页面: universal 抓取源。在请求中启用解析,以接收结构化产品数据(例如 title, price, availability以及 specifications),而非原始 HTML。

结构化 Google Scholar 结果

Google Scholar 现已成为网页爬虫API中的专用解析源。将 source 设置为 google_scholar 并将 parse 设置为 true ,即可直接接收解析后的 JSON。

提高难以访问目标的成功率

我们已改进在使用 CAPTCHA 的网站上处理请求的方式。这些目标的成功率应会提高,尤其是此前失败率或重试率较高的作业。请在我们的 文档.

中了解更多。

来自 Walmart 电商源 的解析输出现在会返回价格数据 更可靠且更一致地。如果您正在跟踪竞争对手价格或监控产品目录,使用以下方式发起的新请求将自动获得更干净的数值: "parse": true.

改进指纹验证和设备内存对齐

无头浏览器 现在提供更逼真的浏览器指纹,并持续使设备内存值与模拟指纹的其余部分保持一致,从而降低所有用户的检测风险。此变更会自动应用于所有无头浏览器会话。

Oxylabs Agent Skills

Oxylabs 现在提供官方 Agent Skills – 一种结构化技能文件,可让 AI 代理和编码助手以显著更准确的代码和更少的幻觉来使用 Oxylabs 产品。

每个 Oxylabs 代理技能都针对特定产品,Claude、Cursor 或 GitHub Copilot 等工具可以选择正确的产品,并通过最新信息处理所有技术细节。

请在官方 Oxylabs Agent-Skills 存储库中查找设置说明和所有技能文件。

ChatGPT 网页搜索的引文重试

ChatGPT 源 使用 search 设置为 true 的请求现在会自动重试引文提取,使解析后的 citations 字段中的引文覆盖率大致翻倍。

总体请求成功率保持不变,已使用以下设置的请求无需更改载荷: search: true.

面向 LLM 目标的批量请求

LLM 源 现已支持 最多 5,000 条提示词 可在针对以下对象的单个批量请求中提交: chatgpt, gemini以及 perplexity 源。每条提示词都会作为独立作业运行,因此每条提示词都会返回一个作业 ID。详细了解批量请求 此处.

控制面板登录:Microsoft Entra SSO

Oxylabs 控制面板登录现已支持 Microsoft Entra ID (原 Azure AD),除 Google 和 Okta 外还支持单点登录 (SSO)。

要设置 Entra SSO,请联系您的 Oxylabs 客户经理,并对组织中的用户进行身份验证,使其通过 Entra ID 登录,而非使用电子邮件和密码。前往 控制面板登录页面 开始操作。

网页爬虫API新增和更新的 LLM 源

网页爬虫API LLM 和 AI 源 现在提供专用的 gemini 源,以及更新的 chatgpt 并将 perplexity 爬虫。所有 LLM 源现在具有更一致的请求结构、更精简的输出封装,并包含新的响应字段(引文、购物、广告等)。

视频数据API的部分下载(剪辑)

YouTube Downloader 现在可通过添加 start_at 并将 end_atcontext 数组,下载视频的特定片段而非完整文件。两个参数均采用 hh:mm:ss 时间戳格式。

视频数据API:视频质量选择

YouTube Downloader 现在支持通过 context: video_quality 参数选择下载视频的分辨率,范围从 144p 一直到 8K.

视频数据API的错误代码

网页爬虫API youtube_download 源现在会在作业状态响应中返回特定的 错误代码 ,以便在无法下载视频时更轻松地排查问题。

充值流程改进

以下产品的充值: 住宅代理, 移动代理, 数据中心代理(按 GB 计费), 网页解锁器以及 网页爬虫API 不再限制为固定金额。现在,您可以输入套餐允许范围内的任意金额,而无需从预设列表中选择。

Oxylabs 控制面板 API

控制面板 API 允许用户以编程方式访问 Oxylabs 的产品使用统计数据,包括 数据中心代理 (DC) 并将 无头浏览器 (HB) ,以实现自动化报告和实时使用情况监控,而无需直接使用 Oxylabs 控制面板。

HTTP/3 协议支持

HTTP/3 协议现已受到 住宅代理 并将 移动代理支持。可通过带有 SOCKS5 端点访问,并支持 UDP

会话 IP 更换控制

住宅代理 并将 移动代理 现在通过以下方式支持新的粘性会话模型: sessid_oneip,它允许您在原始出口节点保持可用的情况下维持同一 IP,最长可达设定的会话时长,并且不会在会话到期后分配新 IP。

新增代理地点

多个自助式代理产品新增了地点:

无头浏览器的城市和州级定位

现在,您可以将您的 无头浏览器 会话的地理位置设置到城市或州级别。新增参数包括 p_city 用于城市,以及 p_state 用于州或地区定位。

改进代理升级流程

现在,您可以升级 独享 ISP, ISP, 数据中心(按 IP 计费)以及 独享数据中心代理 套餐:对于 0 到 100 的范围,最低仅需 5 个 IP(此前最低要求为 20 个 IP)。

升级摘要现在还提供更多详情,包括折扣明细和确切账单日期,便于扩展。

Google Domain 参数不再可用

网页爬虫API domain 适用于 google 源的参数不再可用。要本地化您的搜索,请使用 geo_location 参数。有关更多详情,请查看我们的 geo_location 参数结构 此处.

重命名解锁浏览器

我们将更改产品命名: 解锁浏览器现更名为 无头浏览器. 这只是名称变更,所有核心功能、特性和集成将与现有工作流程保持不变。

新增 ASN 提供商

Cox 和 Deutsche Telekom 的 IP 现已纳入 ISP 代理 并将 独享 ISP 代理 池。独享 ISP 代理用户可以直接从 Oxylabs 控制面板选择其首选的高级 ASN 提供商。

独享ISP代理

独享ISP代理 现已在自助服务控制面板中提供。这种新代理类型提供来自高级 ISP 提供商的完全独享静态 IP,并且可自由选择首选 ASN。独享 ISP 代理提供顶级速度、稳定连接、最大程度的可定制性以及无限时长会话。

在以下文档中了解更多: 独享ISP代理文档.

住宅代理的高级筛选器

住宅代理支持 两种高级筛选器 ,让您拥有更多控制权:

  • 平台(操作系统)pl 参数,用于为 TCP 连接选择住宅代理的操作系统(例如 Windows、iOS)。这样,您可以通过匹配 HTTP 和 TCP 指纹来提高抓取成功率。

  • IP 版本 – 您可以通过以下设置,仅从整个住宅代理池中获取 IPv4 或 IPv6 地址: ipversion-4ipversion-6 参数。

结果聚合器

网页爬虫API用户现在可以使用 结果聚合器将多个抓取结果捆绑为大型批量文件,以简化存储。请通过 /v1/aggregators 端点创建自定义聚合器,并通过在抓取请求载荷中添加 aggregate_name 参数将作业路由到该聚合器。

解锁浏览器会话检查

解锁浏览器现在通过基于 VNC 的 会话检查工具支持实时可视化检查。将 o_vnc=true 添加到您的连接端点(例如 wss://user:pass@ubc.oxylabs.io?o_vnc=true),即可打开无头浏览器的实时图形视图并直接与其交互。

新增数据中心代理地点

五个新的 数据中心代理地点 现已面向按流量(按 GB)计费的用户提供: 拉脱维亚, 斯洛文尼亚, 斯洛伐克, 希腊以及 奥地利。现在可以通过这些国家路由请求,以优化覆盖范围和性能。

YouTube 自动完成抓取源

网页爬虫API现在可以 获取 YouTube 搜索词建议 ,使用新的 youtube_autocomplete 源。它允许用户发现任何搜索查询的相关关键词,随后可将其与 youtube_search 源结合使用,以发现更多相关视频。

更新 Google Shopping 源

Google Shopping 源 现已使用基于令牌的系统,取代 product_id 工作流程。 google_shopping_search (启用 render 后)现在提供 token ,该令牌是以下请求所必需的: google_shopping_product 请求。

此外, google_shopping_pricing 不再作为独立源受支持。要提取 价格 数据,请使用 google_shopping_product source.

最后, google_shopping_product 现在可以通过使用以下设置提交作业来展开“更多商店”面板,以访问额外商品列表: render: 'html' (仅可进行首次展开)。

自修复解析器预设

用户现在可以为其 解析器预设 启用自修复,方法是设置 "self_heal": true 到预设配置中。此功能允许 Oxylabs 在目标网站发生变化导致解析器预设开始失败时,自动调整您的解析器指令。

YouTube 频道

用户现在可以 抓取 YouTube 频道数据 使用新的专用源—— youtube_channel。只需提供 YouTube channel_handle.

YouTube 字幕

网页爬虫API现已支持 提取 YouTube 字幕和隐藏式字幕 (CC) 使用一个新源—— youtube_subtitles。用户现在可以获取 auto_generated 并将 user_provided 字幕,只需提供 YouTube 视频 ID 和字幕语言代码。

使用网页爬虫API抓取 Google AI Overviews

google_search 并将 google_ads 源现可在所有可用地区返回 AI Overviews 结果以及标准 SERP 数据,并支持每个响应包含多个 AI 区块,包括“People also ask”和“Things to know”。

网页爬虫API新增专用源

为网页爬虫API新增了 3 个专用目标: perplexity, chatgpt, google_ai_mode。这些目标可从 AI 搜索界面提取由 LLM 生成的响应。请参阅 此表.

Markdown 输出

您现在可以请求 markdown 输出 ,除 HTML 或已解析的 JSON 外。若要在响应中获取 markdown 内容,请在请求中设置 "markdown": true

单个 API 响应中的多格式输出

新增

  • 获取 多种输出格式 的功能,可在单个 API 响应中返回

  • 支持 Realtime 和 Push-Pull 集成方式

已更改

  • 类型 URL 参数现在支持结果类型列表(parsed, markdown, png, xhr, raw),而非单个值

解析器预设

新增以下功能: 创建, 复用以及 管理 自定义 解析器预设 ,可通过网页爬虫API使用。解析器预设托管在我们的系统中,方便您在多个抓取任务中使用。此外,您还可以监控每个预设的使用情况和性能指标。

数据中心代理按流量计费的使用量提醒

使用 数据中心代理 且采用 按流量订阅 的客户,现在将在每月流量使用达到 80% 和 100% 时收到电子邮件通知。请前往 我的账户电子邮件通知 ,在仪表板中选择您希望收到通知的阈值、添加多个收件人电子邮件地址,或完全禁用这些通知。

AI Studio——发布第 5 款应用

AI Studio 现包含 5 款 AI 驱动工具 ,您可以使用 自然语言提示词控制它们。每个应用都可自动执行特定的网页抓取任务,同时消除常见痛点。我们的工具包包括 AI-Crawler, AI-Scraper, Browser Agent, AI-Search,以及新加入的 AI-Map.

网页爬虫API按功能计费

采用按功能计费后,定价会根据抓取复杂度进行调整,并基于渲染要求和目标类型提供不同费率。此外,我们的 免费试用期现已不限时 ,包含 最多 2,000 条结果 ,供您测试我们的产品。

Cloud Storage 文件命名模板

新增支持 自定义文件命名模板 ,当将结果保存至 Cloud Storage时。您现在可以使用已提交的 任务参数 并将 job_info 变量 定义文件名和目录路径。这让整理和识别文件更加容易。

Google 反向图片搜索抓取源不再可用

Google 反向图片搜索(google_images)源因 Google 停用该功能而不再受支持。您现在可以改用 Google Lens (google_lens )源,它提供等效服务并遵循相同的输入和输出格式。

XHR 请求捕获

网页爬虫API现已支持 捕获网络请求 (Fetch/XHR) ,以便更轻松地从 JavaScript 密集型网站抓取动态内容。设置该 xhr 参数为 true ,即可直接从 API 响应中提取数据,而非解析 HTML。

Alibaba Cloud OSS 和其他兼容 S3 的存储

网页爬虫API现已支持 Alibaba Cloud Object Storage Service 并将 其他兼容 S3 的存储解决方案 设置。若要将抓取结果保存到这些存储桶,请设置 storage_type 设置为 s3_compatible 并提供您的 storage_url.

Amazon 搜索的高级筛选和排序

新增 sort_by 并将 refinements 参数添加到我们的 Amazon 搜索 源,以便根据价格、品牌、颜色和其他筛选条件进行更精准的抓取。

AI 驱动的浏览器指令

用户现在可以 使用 AI 生成浏览器指令 ,在仪表板的 网页爬虫API Playground 中。无需手动选择每项操作,只需输入提示词,指令便会自动生成。

解锁浏览器文档

文档现已提供解锁浏览器:

查看文档

在一处查找有关 CAPTCHA Solving Events、Device Type 等的所有设置信息。

进一步了解解锁浏览器

用于视频下载的高带宽代理

推出 高带宽代理 - 大规模抓取视频和音频数据 ,配备 200+ Gbps 专用带宽、智能 IP 轮换和长连接,专为不间断的大批量下载而打造。 完全兼容 yt-dlp 及其他开源库,易于集成,并通过专用代理出口节点针对速度、稳定性和规模进行优化。

通过 API 获取视频抓取和 AI 就绪数据

推出 视频数据API ——AI 就绪基础设施 ,用于查找相关视频、频道和播放列表,下载视频/音频文件,提取转录文本,并通过元数据丰富所有内容——无需构建或维护自己的爬虫。

合乎道德的 YouTube 视频数据集

访问高质量、经创作者批准的 视频数据集 ,包含丰富的 元数据、转录文本和 720p+ 分辨率 ——可直接用于 训练和微调 AI 模型。无需抓取,无需法律烦恼,只有干净且可扩展的视频数据。

文档改进

Oxylabs 文档现将所有设置和故障排除内容集中于一处:

使用电商网络数据平台获取干净数据

推出 Oxylabs 的新产品—— 电商 网络数据平台。 借助此平台,您可以从 Walmart、Amazon、Shopee 和其他顶级电商平台获取干净数据。

新产品发布——解锁浏览器

我们已推出 解锁浏览器,一款 无头、完全托管的 浏览器 ,可模拟真实浏览行为,以 应对机器人流量管理系统CAPTCHA 并自动处理它们,轻松访问复杂的 JavaScript 密集型网站

网页爬虫API新增 30 个参数化源

网页爬虫API 现已支持 30 个新的参数化源 ——选择搜索词、商店 ID 或邮政编码等参数,并 自动构建您的请求。

网页爬虫API和网页解锁器的使用限额电子邮件通知

您现在可以设置 电子邮件提醒 ,以便在您的 网页爬虫API网页解锁器 使用量达到 80% 和/或 100% 月度订阅限额时收到通知。

Google AI Overviews 响应架构更新

Google AI Overview 响应结构 现已支持 多个 AI Overview 区块 位于单个响应中。此前仅限于单个对象, 该架构现在返回 AI Overview 对象数组,确保您获取 Google 搜索结果中的所有 AI 生成内容。

Google 相关搜索架构改进

我们已改进 Google 网页搜索 相关搜索架构 ,包含 ,实现更精确的位置追踪 ,适用于多个相关搜索区块。您现在可直接在其已解析数据中获取详细且位置特定的相关搜索结果。

OxyCopilot 提示词和代码示例库

我们已推出 OxyCopilot 提示词库 ,包含 可直接使用的 AI 提示词 和代码示例,用于抓取和解析任务。用户现在可以遵循分步指南,为特定目标生成请求,并查看由以下工具生成的已解析数据示例: OxyCopilot.

多模态视频数据提取

网页爬虫API 现已支持 多模态 YouTube 数据提取 ,包含四个新源: youtube_search, youtube_download, youtube_transcripts以及 youtube_metadata。用户现在可以获取 视频、音频、转录文本和元数据 ,适用于 AI 应用和高级分析。

网页爬虫API任务管家新增端点

我们为网页爬虫API新增了两个端点 任务管家 ,以便更好地了解计划任务。用户现在可以获取 任意计划的 运行历史记录 (/runs) 以及 已执行任务列表 (/jobs)。

代理:新增国家

  • 现可通过仪表板购买比利时和加拿大的 ISP代理。

  • 现可使用意大利、新加坡和波兰的数据中心代理。

  • 独享数据中心代理现可使用意大利、新加坡、西班牙和波兰地区。

无代码浏览器指令

用户现在可以通过简单几步在 网页爬虫API Playground 中创建浏览器指令,无需手动编写代码——设置操作、生成结构化 JSON,并导出以供进一步使用。

抓取 Amazon 时设置货币

您现在可以在抓取 Amazon 产品、搜索、定价和畅销商品页面时指定货币!只需添加 context:currency 参数即可定义价格货币。查找可用值 此处 ,或参阅相应的 Amazon 文档页面。

住宅代理和移动代理的使用量提醒

随时掌握情况,避免服务中断。当您的住宅代理和移动代理接近月度订阅限额时,您现在可以收到电子邮件通知。若要启用或禁用此功能,只需前往 我的账户 > 电子邮件通知 仪表板中的此处。

仪表板:转让团队所有权

您现在可以通过仪表板中“我的账户”->“团队”下的三个步骤转让团队所有权:选择新所有者、确认转让,然后由新所有者接受邀请。

Kroger 的更多本地化功能

您现在可以为 delivery_zip 设置代码,以便为 Kroger 指定精确的配送地点,并使用 fulfillment_type 参数选择首选订单方式,包括 ship, pickup, delivery,或 in_store.

5 个免费数据中心 IP

所有新注册用户现在均可获得 5 个免费数据中心 IP 来测试服务——无需信用卡。 立即注册 或查看 我们的文档 以开始使用。

最后更新于

这有帮助吗?