For the complete documentation index, see llms.txt. This page is also available as Markdown.

Scholar

El scraper de Google Scholar te permite enviar consultas de búsqueda y recibir datos estructurados y analizados que incluyen artículos, libros, citas y enlaces relacionados.

La google_scholar La fuente de datos está diseñada para recuperar resultados de búsqueda de Google Scholar, incluidos artículos académicos, libros, citas y enlaces relacionados.

Ejemplos de solicitudes

En este ejemplo, hacemos una solicitud para recuperar resultados de Google Scholar para la consulta best novels.

curl 'https://realtime.oxylabs.io/v1/queries' \\
--user 'USERNAME:PASSWORD' \\
-H 'Content-Type: application/json' \\
-d '{
        "source": "google_scholar",
        "query": "best novels",
        "render": "html",
        "parse": true
    }'
import requests
from pprint import pprint

# Structure payload.
payload = {
  "source": "google_scholar",
  "query": "best novels",
  "render": "html",
  "parse": True
}

# Get response.
response = requests.request(
    'POST',
    'https://realtime.oxylabs.io/v1/queries',
    auth=('USERNAME', 'PASSWORD'),
    json=payload,
)

# Print prettified response to stdout.
pprint(response.json())

Usamos el método de integración síncrona Realtime en nuestros ejemplos. Si deseas usar Proxy Endpoint o una integración asíncrona Push-Pull , consulta la sección de métodos de integración .

Parámetros de la solicitud

Parámetro
Descripción
Valor predeterminado

source

Establece el scraper. Usa google_scholar.

query

Término de búsqueda para la solicitud.

render

Habilita el renderizado de JavaScript cuando se establece en html. Más información.

parse

Devuelve datos analizados cuando se establece en true. Consulta más en diccionario de salida.

false

callback_url

URL para tu endpoint de callback. Más información.

user_agent_type

Tipo de dispositivo y navegador. La lista completa se puede encontrar aquí.

desktop

– parámetro obligatorio

Datos estructurados

Web Scraper API puede extraer resultados HTML o una respuesta JSON que contiene datos estructurados de varios elementos de la página de resultados.

Salida estructurada de google_scholar

Diccionario de salida

La tabla siguiente presenta una lista detallada de cada elemento de nivel superior que analizamos, junto con su descripción y tipo de datos.

El número de resultados orgánicos y ciertos campos pueden variar según la consulta de búsqueda y el tipo de resultado.

Clave
Descripción
Tipo

url

URL de la página de resultados de búsqueda de Google Scholar.

cadena

page

Número de página actual de los resultados de búsqueda.

entero

parse_status_code

El código de estado del trabajo de análisis. Más información aquí.

entero

organic

Lista de resultados orgánicos de búsqueda. Incluye pos, title, url, description, id_de_resultado, tipo_de_resultado, información_de_publicación, enlaces_en_línea, recursos.

arreglo

organic.tipo_de_resultado

Identifica el formato del resultado (libro, PDF, etc.). Se omite cuando el resultado es un artículo estándar.

cadena

organic.información_de_publicación

Resumen de la publicación. Incluye resumen (autores, año, editor/fuente como una sola cadena) y, cuando esté disponible, una lista estructurada de autores con id_de_autor, nombre, y perfil url.

objeto

organic.enlaces_en_línea

Metadatos académicos adjuntos al resultado. Incluye URL_de_cita, citado_por, URL_de_páginas_relacionadas, versiones.

objeto

organic.enlaces_en_línea.citado_por

Datos de citas del resultado. Incluye id_de_citas, total (conteo total de citas), y url (enlace a las obras que citan).

objeto

organic.enlaces_en_línea.URL_de_páginas_relacionadas

URL para encontrar artículos relacionados con el resultado.

cadena

organic.enlaces_en_línea.versiones

Versiones/enlaces alternativos para el mismo documento. Incluye id_de_clúster, total, y url.

objeto

organic.recursos

Enlaces de descarga directa para medios accesibles, p. ej. PDFs. Incluye formato_de_archivo, title, url.

arreglo

paginación

Detalles sobre las páginas de resultados actuales y disponibles. Incluye página_actual, página_siguiente, otras_páginas.

objeto

búsquedas_relacionadas

Cadenas de búsqueda relacionadas sugeridas por Google. Incluye query y url para cada sugerencia.

arreglo

información_de_búsqueda

Detalles generales sobre la búsqueda. Incluye consulta_mostrada, tiempo_transcurrido_mostrado, recuento_total_de_resultados.

objeto

creado_en

Marca de tiempo en que se creó el trabajo de scraping.

marca_de_tiempo

actualizado_en

Marca de tiempo en que se terminó el trabajo de scraping.

marca_de_tiempo

id_del_trabajo

ID del trabajo asociado con el trabajo de scraping.

cadena

código_de_estado

Código de estado del trabajo de scraping. Más información aquí.

entero

Última actualización

¿Te fue útil?