Scholar
O raspador do Google Scholar permite enviar consultas de busca e receber dados estruturados e parseados, incluindo artigos, livros, citações e links relacionados.
O google_scholar A fonte de dados foi projetada para recuperar resultados de pesquisa do Google Scholar, incluindo artigos acadêmicos, livros, citações e links relacionados.
Exemplos de requisição
Neste exemplo, fazemos uma requisição para recuperar resultados do Google Scholar para a consulta melhores romances.
curl 'https://realtime.oxylabs.io/v1/queries' \\
--user 'USERNAME:PASSWORD' \\
-H 'Content-Type: application/json' \\
-d '{
"source": "google_scholar",
"query": "best novels",
"render": "html",
"parse": true
}'import requests
from pprint import pprint
# Structure payload.
payload = {
"source": "google_scholar",
"query": "best novels",
"render": "html",
"parse": True
}
# Get response.
response = requests.request(
'POST',
'https://realtime.oxylabs.io/v1/queries',
auth=('USERNAME', 'PASSWORD'),
json=payload,
)
# Print prettified response to stdout.
pprint(response.json())Usamos o método de integração síncrona Realtime método de integração em nossos exemplos. Se você quiser usar Proxy Endpoint ou integração assíncrona Push-Pull de integração, consulte a métodos de integração seção.
Parâmetros da requisição
source
Define o scraper. Use google_scholar.
–
query
Termo de busca da requisição.
–
– parâmetro obrigatório
Dados estruturados
Web Scraper API pode extrair resultados em HTML ou uma resposta JSON que contém dados estruturados em vários elementos da página de resultados.
Dicionário de saída
A tabela abaixo apresenta uma lista detalhada de cada elemento de nível superior que analisamos, junto com sua descrição e tipo de dado.
url
URL da página de resultados de pesquisa do Google Scholar.
string
page
Número da página atual dos resultados de pesquisa.
integer
organic
Lista de resultados orgânicos. Inclui pos, title, url, description, id_do_resultado, tipo_do_resultado, informações_da_publicação, links_embutidos, recursos.
array
organic.tipo_do_resultado
Identifica o formato do resultado (livro, PDF, etc.). Omitido quando o resultado é um artigo padrão.
string
organic.informações_da_publicação
Resumo da publicação. Inclui resumo (autores, ano, editora/fonte como uma única string) e, quando disponível, uma estrutura autores lista com id_do_autor, nome, e perfil url.
objeto
organic.links_embutidos
Metadados acadêmicos anexados ao resultado. Inclui url_de_citação, citado_por, url_de_páginas_relacionadas, versões.
objeto
organic.links_embutidos.citado_por
Dados de citação do resultado. Inclui id_de_citação, total (contagem total de citações), e url (link para trabalhos que citam).
objeto
organic.links_embutidos.url_de_páginas_relacionadas
URL para encontrar artigos relacionados ao resultado.
string
organic.links_embutidos.versões
Versões/links alternativos para o mesmo documento. Inclui id_do_cluster, total, e url.
objeto
organic.recursos
Links diretos de download para mídias acessíveis, por exemplo, PDFs. Inclui formato_do_arquivo, title, url.
array
paginação
Detalhes sobre as páginas de resultados atuais e disponíveis. Inclui página_atual, próxima_página, outras_páginas.
objeto
pesquisas_relacionadas
Strings de pesquisa relacionadas sugeridas pelo Google. Inclui query e url para cada sugestão.
array
informações_da_pesquisa
Detalhes gerais sobre a pesquisa. Inclui consulta_exibida, tempo_gasto_exibido, contagem_total_de_resultados.
objeto
criado_em
Carimbo de data/hora em que o trabalho de scraping foi criado.
carimbo_de_data_hora
atualizado_em
Carimbo de data/hora em que o trabalho de scraping foi concluído.
carimbo_de_data_hora
id_do_trabalho
ID do trabalho associado ao trabalho de scraping.
string
Atualizado
Isto foi útil?

