新闻搜索
大规模抓取 Google 新闻结果并获取完全解析的数据。提取包含标题、来源和发布日期的文章。
要抓取 Google News 搜索,请包含 context:udm 参数,并将值设置为 12 或 context:tbm 参数,并将值设置为 nws.
请求示例
在下面的示例中,我们发送请求以获取搜索词为 adidas.
udm
curl 'https://realtime.oxylabs.io/v1/queries' \\
--user 'USERNAME:PASSWORD' \\
-H 'Content-Type: application/json' \\
-d '{
"source": "google_search",
"query": "adidas",
"parse": true,
"context": [
{
"key": "udm",
"value": 12
}
]
}'import requests
from pprint import pprint
# Structure payload.
payload = {
'source': 'google_search',
'query': 'adidas',
'parse': True,
'context': [
{'key': 'udm', 'value': 12},
],
}
# Get response.
response = requests.post(
'https://realtime.oxylabs.io/v1/queries',
auth=('USERNAME', 'PASSWORD'),
json=payload,
)
# Print prettified response to stdout.
pprint(response.json())tbm
我们的示例使用同步 Realtime 集成方式。如果你想使用 Proxy Endpoint 或异步 Push-Pull 集成,请参阅 集成方式 部分。
请求参数值
通用
抓取 Google News 搜索结果的基本设置和自定义选项。
source
设置爬虫。使用 google_search.
–
query
要搜索的关键词或短语。
–
context:
tbm
要获取 News 搜索结果,请将值设置为 nws。其他可接受的值有: app, blg, bks, dsc, isch, pts, plcs, rcp, lcl
–
- 必填参数
注意: udm 和 tbm context 参数不能在单个抓取请求中一起使用;请选择其中一个。同时使用两者可能会导致冲突或意外行为。
Google 高级搜索运算符
本地化
将搜索结果适配到特定地理位置和语言。
分页
用于管理分页和检索搜索结果。
start_page
起始页码。
1
pages
要检索的页数。
1
limit
每页要检索的结果数量。
10
context:
limit_per_page
如果你想使用同一 IP 地址抓取多个页面,请包含一个 JSON 数组,并使用 page 键指定页码。你还必须通过添加一个 limit 键来指明每页的自然结果数量。 查看示例.
-
每页限制
要使用此功能,请包含一个带有以下数据的 JSON 对象数组:
page
你想抓取的页码。任何大于 0 的整数值均可
1
limit
当前页上的结果数量。任何介于 1 和 100 (含)之间的整数值均可。
90
请求示例
过滤
可根据各种条件筛选并细化搜索结果。
context:safe_search
安全搜索。设为 true 以启用。
false
context:
tbs
tbs 参数。此参数类似于一个容器,用于放置更隐晦的 Google 参数,例如按日期限制/排序结果以及其他筛选条件,其中一些取决于 tbm 参数(例如 tbs=app_os:1 仅适用于 tbm 值 app)。更多信息 这里.
-
其他
用于特殊需求的附加高级设置和控制。
context:
nfpr
true 将关闭拼写自动更正
false
上下文参数
所有上下文参数都应添加到 context 数组中,作为具有 键 和 值 对的对象,例如:
结构化数据
SERP 爬虫 API 能够提取包含 Google 搜索结果的 HTML 或 JSON 对象,并在结果页面的各个元素上提供结构化数据。
输出数据字典
HTML 示例

JSON 结构
Google 新闻搜索的结构化输出包含以下字段: URL, page, results以及其他字段。下表列出了我们解析的每个 SERP 功能的详细信息,包括其描述和数据类型。表中还包含一些元数据。
url
Google 搜索页面的 URL。
字符串
results
包含搜索结果的字典。
数组
results.main
未付费新闻结果列表及其各自的详细信息。
数组
results.additional
趋势文章列表及其各自的详细信息。
对象
results.total_results_count
搜索查询找到的结果总数。
数组
created_at
抓取任务创建时的时间戳。
时间戳
updated_at
抓取任务完成时的时间戳。
时间戳
page
相对于 Google SERP 分页的页码。
整数
job_id
与抓取任务关联的任务 ID。
字符串
主要
显示未付费新闻结果列表,并提供每篇文章的相关详细信息。

url
完整文章的 URL。
字符串
desc
完整文章的简短摘录。
字符串
title
文章标题。
字符串
source
文章发布的网站名称。
字符串
pos_overall
表示该结果在 News SERP 主要结果中的总体位置。
整数
relative_publish_date
描述文章发布于多久之前。
字符串
其他
展示趋势文章列表及其相关详细信息。

items
文章列表及其各自详细信息。
数组
items.pos
用于标示文章在列表中的唯一标识。
整数
items.url
完整文章的 URL。
字符串
items.title
文章标题。
字符串
items.source
文章发布的网站名称。
字符串
items.relative_publish_date
描述文章发布于多久之前。
字符串
pos_overall
表示该结果在 News SERP 附加结果中的总体位置。
整数
section_title
附加部分的名称。
字符串
最后更新于
这有帮助吗?

