For the complete documentation index, see llms.txt. This page is also available as Markdown.

Scholar

El scraper de Google Scholar te permite enviar consultas de búsqueda y recibir datos estructurados y analizados, incluidos artículos, libros, citas y enlaces relacionados.

El google_scholar La fuente de datos está diseñada para recuperar resultados de búsqueda de Google Scholar, incluidos artículos académicos, libros, citas y enlaces relacionados.

Ejemplos de solicitud

En este ejemplo, hacemos una solicitud para recuperar resultados de Google Scholar para la consulta mejores novelas.

curl 'https://realtime.oxylabs.io/v1/queries' \\
--user 'USERNAME:PASSWORD' \\
-H 'Content-Type: application/json' \\
-d '{
        "source": "google_scholar",
        "query": "best novels",
        "render": "html",
        "parse": true
    }'
import requests
from pprint import pprint

# Structure payload.
payload = {
  "source": "google_scholar",
  "query": "best novels",
  "render": "html",
  "parse": True
}

# Get response.
response = requests.request(
    'POST',
    'https://realtime.oxylabs.io/v1/queries',
    auth=('USERNAME', 'PASSWORD'),
    json=payload,
)

# Print prettified response to stdout.
pprint(response.json())

Usamos Realtime el método de integración sincrónica en nuestros ejemplos. Si desea usar Proxy Endpoint o asincrónica Push-Pull de integración, consulte la sección de métodos de integración .

Parámetros de solicitud

Parámetro
Descripción
Valor predeterminado

source

Establece el scraper. Use google_scholar.

query

Término de búsqueda para la solicitud.

render

Habilita la renderización de JavaScript cuando se establece en html. Más información.

parse

Devuelve datos analizados cuando se establece en true. Vea más en diccionario de salida.

false

callback_url

URL a su endpoint de callback. Más información.

user_agent_type

Tipo de dispositivo y navegador. La lista completa se puede encontrar aquí.

desktop

– parámetro obligatorio

Datos estructurados

Web Scraper API puede extraer resultados HTML o una respuesta JSON que contiene datos estructurados de varios elementos de la página de resultados.

Salida estructurada de google_scholar

Diccionario de salida

La tabla siguiente presenta una lista detallada de cada elemento de nivel superior que analizamos, junto con su descripción y tipo de datos.

El número de resultados orgánicos y ciertos campos pueden variar según la consulta de búsqueda y el tipo de resultado.

Clave
Descripción
Tipo

url

URL a la página de resultados de búsqueda de Google Scholar.

cadena

page

Número de página actual de los resultados de búsqueda.

entero

parse_status_code

El código de estado del trabajo de análisis. Más información aquí.

entero

organic

Lista de resultados orgánicos de búsqueda. Incluye pos, title, url, description, id_del_resultado, tipo_del_resultado, información_de_publicación, enlaces_en_línea, recursos.

arreglo

organic.tipo_del_resultado

Identifica el formato del resultado (libro, PDF, etc.). Se omite cuando el resultado es un artículo estándar.

cadena

organic.información_de_publicación

Resumen de la publicación. Incluye resumen (autores, año, editor/fuente como una sola cadena) y, cuando esté disponible, una autores lista con id_del_autor, nombre, y perfil url.

objeto

organic.enlaces_en_línea

Metadatos académicos adjuntos al resultado. Incluye url_de_cita, citado_por, url_de_páginas_relacionadas, versiones.

objeto

organic.enlaces_en_línea.citado_por

Datos de citación del resultado. Incluye id_de_citas, total (recuento total de citas), y url (enlace a los trabajos que citan).

objeto

organic.enlaces_en_línea.url_de_páginas_relacionadas

URL para encontrar artículos relacionados con el resultado.

cadena

organic.enlaces_en_línea.versiones

Versiones/enlaces alternativos para el mismo documento. Incluye id_del_clúster, total, y url.

objeto

organic.recursos

Enlaces de descarga directa para medios accesibles, p. ej. PDFs. Incluye formato_del_archivo, title, url.

arreglo

paginación

Detalles sobre las páginas de resultados actuales y disponibles. Incluye página_actual, página_siguiente, otras_páginas.

objeto

búsquedas_relacionadas

Cadenas de búsqueda relacionadas sugeridas por Google. Incluye query y url para cada sugerencia.

arreglo

información_de_búsqueda

Detalles generales sobre la búsqueda. Incluye consulta_mostrada, tiempo_transcurrido_mostrado, conteo_total_de_resultados.

objeto

creado_en

Marca de tiempo en que se creó el trabajo de scraping.

marca_de_tiempo

actualizado_en

Marca de tiempo en que se completó el trabajo de scraping.

marca_de_tiempo

id_del_trabajo

ID del trabajo asociado con el trabajo de scraping.

cadena

código_de_estado

Código de estado del trabajo de scraping. Más información aquí.

entero

Última actualización

¿Te fue útil?