Scholar
El scraper de Google Scholar te permite enviar consultas de búsqueda y recibir datos estructurados y analizados que incluyen artículos, libros, citas y enlaces relacionados.
La google_scholar La fuente de datos está diseñada para recuperar resultados de búsqueda de Google Scholar, incluidos artículos académicos, libros, citas y enlaces relacionados.
Ejemplos de solicitudes
En este ejemplo, hacemos una solicitud para recuperar resultados de Google Scholar para la consulta best novels.
curl 'https://realtime.oxylabs.io/v1/queries' \\
--user 'USERNAME:PASSWORD' \\
-H 'Content-Type: application/json' \\
-d '{
"source": "google_scholar",
"query": "best novels",
"render": "html",
"parse": true
}'import requests
from pprint import pprint
# Structure payload.
payload = {
"source": "google_scholar",
"query": "best novels",
"render": "html",
"parse": True
}
# Get response.
response = requests.request(
'POST',
'https://realtime.oxylabs.io/v1/queries',
auth=('USERNAME', 'PASSWORD'),
json=payload,
)
# Print prettified response to stdout.
pprint(response.json())Usamos el método de integración síncrona Realtime en nuestros ejemplos. Si deseas usar Proxy Endpoint o una integración asíncrona Push-Pull , consulta la sección de métodos de integración .
Parámetros de la solicitud
source
Establece el scraper. Usa google_scholar.
–
query
Término de búsqueda para la solicitud.
–
parse
Devuelve datos analizados cuando se establece en true. Consulta más en diccionario de salida.
false
– parámetro obligatorio
Datos estructurados
Web Scraper API puede extraer resultados HTML o una respuesta JSON que contiene datos estructurados de varios elementos de la página de resultados.
Diccionario de salida
La tabla siguiente presenta una lista detallada de cada elemento de nivel superior que analizamos, junto con su descripción y tipo de datos.
url
URL de la página de resultados de búsqueda de Google Scholar.
cadena
page
Número de página actual de los resultados de búsqueda.
entero
organic
Lista de resultados orgánicos de búsqueda. Incluye pos, title, url, description, id_de_resultado, tipo_de_resultado, información_de_publicación, enlaces_en_línea, recursos.
arreglo
organic.tipo_de_resultado
Identifica el formato del resultado (libro, PDF, etc.). Se omite cuando el resultado es un artículo estándar.
cadena
organic.información_de_publicación
Resumen de la publicación. Incluye resumen (autores, año, editor/fuente como una sola cadena) y, cuando esté disponible, una lista estructurada de autores con id_de_autor, nombre, y perfil url.
objeto
organic.enlaces_en_línea
Metadatos académicos adjuntos al resultado. Incluye URL_de_cita, citado_por, URL_de_páginas_relacionadas, versiones.
objeto
organic.enlaces_en_línea.citado_por
Datos de citas del resultado. Incluye id_de_citas, total (conteo total de citas), y url (enlace a las obras que citan).
objeto
organic.enlaces_en_línea.URL_de_páginas_relacionadas
URL para encontrar artículos relacionados con el resultado.
cadena
organic.enlaces_en_línea.versiones
Versiones/enlaces alternativos para el mismo documento. Incluye id_de_clúster, total, y url.
objeto
organic.recursos
Enlaces de descarga directa para medios accesibles, p. ej. PDFs. Incluye formato_de_archivo, title, url.
arreglo
paginación
Detalles sobre las páginas de resultados actuales y disponibles. Incluye página_actual, página_siguiente, otras_páginas.
objeto
búsquedas_relacionadas
Cadenas de búsqueda relacionadas sugeridas por Google. Incluye query y url para cada sugerencia.
arreglo
información_de_búsqueda
Detalles generales sobre la búsqueda. Incluye consulta_mostrada, tiempo_transcurrido_mostrado, recuento_total_de_resultados.
objeto
creado_en
Marca de tiempo en que se creó el trabajo de scraping.
marca_de_tiempo
actualizado_en
Marca de tiempo en que se terminó el trabajo de scraping.
marca_de_tiempo
id_del_trabajo
ID del trabajo asociado con el trabajo de scraping.
cadena
Última actualización
¿Te fue útil?

