学术搜索
Google Scholar 抓取器允许你提交搜索查询,并返回结构化解析数据,包括文章、书籍、引用和相关链接。
该 google_scholar 数据源旨在检索 Google Scholar 搜索结果,包括学术论文、书籍、引用和相关链接。
请求示例
在此示例中,我们发出请求以检索查询 最佳小说.
curl 'https://realtime.oxylabs.io/v1/queries' \
--user 'USERNAME:PASSWORD' \
-H 'Content-Type: application/json' \
-d '{
"source": "google_scholar",
"query": "best novels",
"render": "html",
"parse": true
}'import requests
from pprint import pprint
# Structure payload.
payload = {
"source": "google_scholar",
"query": "best novels",
"render": "html",
"parse": True
}
# Get response.
response = requests.request(
'POST',
'https://realtime.oxylabs.io/v1/queries',
auth=('USERNAME', 'PASSWORD'),
json=payload,
)
# Print prettified response to stdout.
pprint(response.json())我们在示例中使用同步 Realtime 集成方法。如果您想使用 Proxy Endpoint 或异步 Push-Pull 集成,请参阅 集成方法 部分。
请求参数
– 必填参数
结构化数据
网页爬虫API 可以提取结果 HTML,或包含结果页面中各种元素结构化数据的 JSON 响应。
输出字典
下表列出了我们解析的每个顶级元素,包括其描述和数据类型。
url
Google Scholar 搜索结果页面的 URL。
字符串
page
搜索结果的当前页码。
整数
organic
自然搜索结果列表。包括 pos, title, url, description, 结果ID, 结果类型, 出版信息, 内联链接, 资源.
数组
organic.result_type
标识结果的格式(书籍, PDF等)。当结果是标准文章时省略。
字符串
organic.publication_info
出版物摘要。包括 摘要 (作者、年份、出版方/来源作为一个字符串),以及在可用时,一个结构化的 作者 列表,包含 作者ID, 姓名,以及个人资料 url.
对象
organic.inline_links
附加到结果的学术元数据。包括 引用URL, 被引, 相关页面URL, 版本.
对象
organic.inline_links.cited_by
结果的引用数据。包括 引用ID, 总数 (引用总数),以及 url (指向引用该结果的文献的链接)。
对象
organic.inline_links.related_pages_url
用于查找与结果相关论文的URL。
字符串
organic.inline_links.versions
同一文档的替代版本/链接。包括 聚类ID, 总数,以及 url.
对象
organic.resources
可访问媒体的直接下载链接,例如PDF。包括 文件格式, title, url.
数组
分页
当前及可用结果页的详细信息。包括 当前页, 下一页, 其他页面.
对象
相关搜索
Google建议的相关搜索字符串。包括 query 和 url 适用于每个建议。
数组
搜索信息
关于搜索的一般信息。包括 显示的查询, 显示的耗时, 结果总数.
对象
创建时间
抓取任务创建时的时间戳。
时间戳
更新时间
抓取任务完成时的时间戳。
时间戳
任务ID
与抓取任务关联的任务ID。
字符串
最后更新于
这有帮助吗?

