For the complete documentation index, see llms.txt. This page is also available as Markdown.

ChatGPT

通过提交提示提取 ChatGPT 回复,解析数据包括回复文本、Markdown 输出、引用、外部链接和 LLM 模型信息。

chatgpt source 允许您向 ChatGPT 提交提示,并接收完全解析的结构化响应,包括纯文本和 Markdown 答案、来源引用、模型使用的搜索查询,以及购物产品和广告。

请求示例

以下代码示例演示如何使用以下方式向 ChatGPT 提交提示 Push-Pull.

curl 'https://data.oxylabs.io/v1/queries' \\
--user 'USERNAME:PASSWORD' \\
-H 'Content-Type: application/json' \\
-d '{
        "source": "chatgpt",
        "prompt": "best supplements for better sleep",
        "parse": true,
        "geo_location": "United States",
        "callback_url": "https://your-server.com/oxylabs-callback"
    }'
import requests
from pprint import pprint

# 结构化载荷。
payload = {
    'source': 'chatgpt',
    'prompt': 'best supplements for better sleep',
    'parse': True,
    'geo_location': "United States",
    'callback_url': "https://your-server.com/oxylabs-callback"
}

# 获取响应。
response = requests.request(
    'POST',
    'https://data.oxylabs.io/v1/queries',
    auth=('USERNAME', 'PASSWORD'),
    json=payload,
)

# Print prettified response to stdout.
pprint(response.json())

注意: 所有 LLM 来源默认启用 JavaScript 渲染。您无需在请求负载中包含渲染参数。

使用以下方式提交作业 Push-Pull 集成(包括 批量查询) 方法会立即返回作业 ID,而不是结果。一旦作业状态为 done,即可获取解析后的响应。参见 集成方式 LLMs 和 AI 页面上的完整提交与检索流程。

请求参数

用于抓取 ChatGPT 的基本设置和自定义选项。

参数
描述
默认值

source

设置爬虫目标。使用 chatgpt.

prompt

要提交给 ChatGPT 的提示或问题。必须少于 4000 个字符。

callback_url

推荐。 作业完成后我们发送通知的 URL。 更多信息

搜索

设置为 true 用于网络搜索。

false

解析

设置为 true 用于结构化 JSON 结果。

false

geo_location

指定请求路由所在的国家/地区。 更多信息.

browser_instructions

渲染 JavaScript 时的可选自定义浏览器指令。 更多信息.

- 必填参数

结构化数据

一旦通过 Push-Pull 结果端点检索到作业,网页爬虫API 会返回包含 ChatGPT 输出的 HTML 或 JSON 对象,其中包含结果页各元素的结构化数据。

chatgpt 结构化输出

输出数据字典

HTML 示例

JSON 结构

所有 LLM 目标返回相同的顶层 作业results[] 封装。参见 LLMs 和 AI 以查看完整的元数据参考。

下表显示 ChatGPT 特定的 results[].content 字段:

特定结果类型的项数和字段数可能因提交的提示而异。

字段
描述
类型

prompt

用于生成结果的已提交提示。

字符串

llm_model

用于该响应的特定 ChatGPT 模型(例如, gpt-4o).

字符串

response_text

来自 ChatGPT 的纯文本响应。

字符串

markdown_text

以 Markdown 格式呈现的 ChatGPT 响应。

字符串

markdown_json

Markdown 响应的结构化 JSON 表示。每个项包含 typechildren.

数组

citations

响应来源引用列表。对象包含 title, url, text, description,以及 section.

数组

search_queries

模型用于收集信息的搜索查询。

字符串数组

links

用于内联来源链接详情的对象列表: urltext.

数组

shopping_products

包含产品详情的对象列表: price, title, rating, 货币, price_str,以及 thumbnail.

数组

ads

广告详情,包含 url, title, image_url, description,以及一个 advertiser_info 对象。

数组

ads.advertiser_info

包含广告主的对象 url, 姓名,以及 image_url

对象

parse_status_code

12000 – 成功。否则,解析器未能提取部分或全部结构化字段。

整数

– 条件返回,仅在内容出现在 LLM 响应中时返回。

最后更新于

这有帮助吗?