For the complete documentation index, see llms.txt. This page is also available as Markdown.

Scholar

O scraper do Google Scholar permite que você envie consultas de busca e receba dados estruturados e analisados, incluindo artigos, livros, citações e links relacionados.

O google_scholar a fonte de dados foi projetada para recuperar resultados de pesquisa do Google Scholar, incluindo artigos acadêmicos, livros, citações e links relacionados.

Exemplos de requisição

Neste exemplo, fazemos uma requisição para recuperar resultados do Google Scholar para a consulta melhores romances.

curl 'https://realtime.oxylabs.io/v1/queries' \
--user 'USERNAME:PASSWORD' \
-H 'Content-Type: application/json' \
-d '{
        "source": "google_scholar",
        "query": "best novels",
        "render": "html",
        "parse": true
    }'
import requests
from pprint import pprint

# Estrutura o payload.
payload = {
  "source": "google_scholar",
  "query": "best novels",
  "render": "html",
  "parse": True
}

# Obtém a resposta.
response = requests.request(
    'POST',
    'https://realtime.oxylabs.io/v1/queries',
    auth=('USERNAME', 'PASSWORD'),
    json=payload,
)

# Imprime a resposta formatada em stdout.
pprint(response.json())

Usamos o método de integração síncrono Realtime em nossos exemplos. Se você quiser usar Proxy Endpoint ou a integração assíncrona Push-Pull , consulte a seção de métodos de integração .

Parâmetros da requisição

Parâmetro
Descrição
Valor padrão

source

Define o scraper. Use google_scholar.

query

Termo de busca para a requisição.

render

Ativa a renderização de JavaScript quando definido como html. Mais informações.

parse

Retorna dados parseados quando definido como true. Veja mais em dicionário de saída.

false

callback_url

URL para seu endpoint de callback. Mais informações.

user_agent_type

Tipo de dispositivo e navegador. A lista completa pode ser encontrada aqui.

desktop

– parâmetro obrigatório

Dados estruturados

Web Scraper API pode extrair resultados em resposta HTML ou JSON que contém dados estruturados em vários elementos da página de resultados.

Saída estruturada de google_scholar

Dicionário de saída

A tabela abaixo apresenta uma lista detalhada de cada elemento de nível superior que analisamos, juntamente com sua descrição e tipo de dado.

O número de resultados orgânicos e alguns campos podem variar dependendo da consulta de pesquisa e do tipo de resultado.

Chave
Descrição
Tipo

url

URL para a página de resultados da pesquisa do Google Scholar.

cadeia de caracteres

page

Número da página atual dos resultados da pesquisa.

inteiro

parse_status_code

O código de status do trabalho de parsing. Saiba mais aqui.

inteiro

organic

Lista de resultados orgânicos. Inclui pos, title, url, description, ID do resultado, Tipo do resultado, Informações da publicação, Links embutidos, Recursos.

vetor

organic.tipo_do_resultado

Identifica o formato do resultado (livro, PDF, etc.). Omitido quando o resultado é um artigo padrão.

cadeia de caracteres

organic.informações_da_publicação

Resumo da publicação. Inclui resumo (authors, ano, editora/fonte como uma única string) e, quando disponível, uma lista estruturada de autores lista com ID do autor, nome, e perfil url.

objeto

organic.links_embutidos

Metadados acadêmicos anexados ao resultado. Inclui URL de citação, citado_por, URL de páginas relacionadas, versões.

objeto

organic.links_embutidos.citado_por

Dados de citação do resultado. Inclui ID das citações, total (contagem total de citações), e url (link para trabalhos que citam).

objeto

organic.links_embutidos.url_de_páginas_relacionadas

URL para encontrar artigos relacionados ao resultado.

cadeia de caracteres

organic.links_embutidos.versões

Versões/links alternativos para o mesmo documento. Inclui ID do cluster, total, e url.

objeto

organic.recursos

Links diretos para mídias acessíveis para download, por exemplo, PDFs. Inclui formato_do_arquivo, title, url.

vetor

paginação

Detalhes sobre a página atual e as páginas de resultados disponíveis. Inclui página_atual, próxima_página, outras_páginas.

objeto

pesquisas_relacionadas

Strings de busca relacionadas sugeridas pelo Google. Inclui query e url para cada sugestão.

vetor

informações_da_pesquisa

Detalhes gerais sobre a pesquisa. Inclui consulta_exibida, tempo_gasto_exibido, contagem_total_de_resultados.

objeto

criado_em

Carimbo de data/hora em que o trabalho de scraping foi criado.

carimbo_de_data_hora

atualizado_em

Carimbo de data/hora em que o trabalho de scraping foi concluído.

carimbo_de_data_hora

ID do trabalho

ID do trabalho associado ao trabalho de scraping.

cadeia de caracteres

código_de_status

Código de status do trabalho de scraping. Saiba mais aqui.

inteiro

Atualizado

Isto foi útil?