For the complete documentation index, see llms.txt. This page is also available as Markdown.

Scholar

O raspador do Google Scholar permite enviar consultas de busca e receber dados estruturados e parseados, incluindo artigos, livros, citações e links relacionados.

O google_scholar A fonte de dados foi projetada para recuperar resultados de pesquisa do Google Scholar, incluindo artigos acadêmicos, livros, citações e links relacionados.

Exemplos de requisição

Neste exemplo, fazemos uma requisição para recuperar resultados do Google Scholar para a consulta melhores romances.

curl 'https://realtime.oxylabs.io/v1/queries' \\
--user 'USERNAME:PASSWORD' \\
-H 'Content-Type: application/json' \\
-d '{
        "source": "google_scholar",
        "query": "best novels",
        "render": "html",
        "parse": true
    }'
import requests
from pprint import pprint

# Structure payload.
payload = {
  "source": "google_scholar",
  "query": "best novels",
  "render": "html",
  "parse": True
}

# Get response.
response = requests.request(
    'POST',
    'https://realtime.oxylabs.io/v1/queries',
    auth=('USERNAME', 'PASSWORD'),
    json=payload,
)

# Print prettified response to stdout.
pprint(response.json())

Usamos o método de integração síncrona Realtime método de integração em nossos exemplos. Se você quiser usar Proxy Endpoint ou integração assíncrona Push-Pull de integração, consulte a métodos de integração seção.

Parâmetros da requisição

Parâmetro
Descrição
Valor padrão

source

Define o scraper. Use google_scholar.

query

Termo de busca da requisição.

render

Ativa a renderização de JavaScript quando definido como html. Mais informações.

parse

Retorna os dados analisados quando definido como true. Veja mais em dicionário de saída.

false

callback_url

URL para seu endpoint de callback. Mais informações.

user_agent_type

Tipo de dispositivo e navegador. A lista completa pode ser encontrada aqui.

desktop

– parâmetro obrigatório

Dados estruturados

Web Scraper API pode extrair resultados em HTML ou uma resposta JSON que contém dados estruturados em vários elementos da página de resultados.

Saída estruturada de google_scholar

Dicionário de saída

A tabela abaixo apresenta uma lista detalhada de cada elemento de nível superior que analisamos, junto com sua descrição e tipo de dado.

O número de resultados orgânicos e certos campos pode variar dependendo da consulta de pesquisa e do tipo de resultado.

Chave
Descrição
Tipo

url

URL da página de resultados de pesquisa do Google Scholar.

string

page

Número da página atual dos resultados de pesquisa.

integer

parse_status_code

O código de status do trabalho de análise. Saiba mais aqui.

integer

organic

Lista de resultados orgânicos. Inclui pos, title, url, description, id_do_resultado, tipo_do_resultado, informações_da_publicação, links_embutidos, recursos.

array

organic.tipo_do_resultado

Identifica o formato do resultado (livro, PDF, etc.). Omitido quando o resultado é um artigo padrão.

string

organic.informações_da_publicação

Resumo da publicação. Inclui resumo (autores, ano, editora/fonte como uma única string) e, quando disponível, uma estrutura autores lista com id_do_autor, nome, e perfil url.

objeto

organic.links_embutidos

Metadados acadêmicos anexados ao resultado. Inclui url_de_citação, citado_por, url_de_páginas_relacionadas, versões.

objeto

organic.links_embutidos.citado_por

Dados de citação do resultado. Inclui id_de_citação, total (contagem total de citações), e url (link para trabalhos que citam).

objeto

organic.links_embutidos.url_de_páginas_relacionadas

URL para encontrar artigos relacionados ao resultado.

string

organic.links_embutidos.versões

Versões/links alternativos para o mesmo documento. Inclui id_do_cluster, total, e url.

objeto

organic.recursos

Links diretos de download para mídias acessíveis, por exemplo, PDFs. Inclui formato_do_arquivo, title, url.

array

paginação

Detalhes sobre as páginas de resultados atuais e disponíveis. Inclui página_atual, próxima_página, outras_páginas.

objeto

pesquisas_relacionadas

Strings de pesquisa relacionadas sugeridas pelo Google. Inclui query e url para cada sugestão.

array

informações_da_pesquisa

Detalhes gerais sobre a pesquisa. Inclui consulta_exibida, tempo_gasto_exibido, contagem_total_de_resultados.

objeto

criado_em

Carimbo de data/hora em que o trabalho de scraping foi criado.

carimbo_de_data_hora

atualizado_em

Carimbo de data/hora em que o trabalho de scraping foi concluído.

carimbo_de_data_hora

id_do_trabalho

ID do trabalho associado ao trabalho de scraping.

string

código_de_status

Código de status do trabalho de scraping. Saiba mais aqui.

integer

Atualizado

Isto foi útil?