Búsqueda de noticias
Extrae resultados de Google News a gran escala y obtén datos completamente analizados. Extrae artículos con títulos, fuentes y fechas de publicación.
La google_search la fuente está diseñada para recuperar resultados de Google Search (SERPs). Esta subpágina presenta específicamente datos relacionados con Google News Search. Para explorar otros tipos de resultados, lea aquí: Búsqueda web, Búsqueda de imágenes.
Para extraer la búsqueda de Google News, incluya el context:udm parámetro con el valor establecido en 12 o context:tbm parámetro con el valor establecido en nws.
Ejemplos de solicitud
En los ejemplos siguientes, hacemos una solicitud para obtener páginas de resultados de búsqueda de News para el término de búsqueda adidas.
udm
curl 'https://realtime.oxylabs.io/v1/queries' \\
--user 'USERNAME:PASSWORD' \\
-H 'Content-Type: application/json' \\
-d '{
"source": "google_search",
"query": "adidas",
"parse": true,
"context": [
{
"key": "udm",
"value": 12
}
]
}'import requests
from pprint import pprint
# Structure payload.
payload = {
'source': 'google_search',
'query': 'adidas',
'parse': True,
'context': [
{'key': 'udm', 'value': 12},
],
}
# Get response.
response = requests.post(
'https://realtime.oxylabs.io/v1/queries',
auth=('USERNAME', 'PASSWORD'),
json=payload,
)
# Print prettified response to stdout.
pprint(response.json())tbm
Usamos el método de integración síncrono Realtime en nuestros ejemplos. Si desea usar Proxy Endpoint o asíncrona Push-Pull integración, consulte la sección de métodos de integración .
Valores de los parámetros de solicitud
Genérico
Opciones básicas de configuración y personalización para extraer resultados de búsqueda de Google News.
source
Establece el scraper. Use google_search.
–
query
La palabra clave o frase a buscar.
–
context:
udm
Para obtener resultados de búsqueda de News, establezca el valor en 12. Encuentre otros valores aceptados aquí.
–
context:
tbm
Para obtener resultados de búsqueda de News, establezca el valor en nws. Los otros valores aceptados son: app, blg, bks, dsc, isch, pts, plcs, rcp, lcl
–
parse
Devuelve datos analizados cuando se establece en true. Explorar salida diccionario de datos.
false
- parámetro obligatorio
Nota: udm y tbm los parámetros context no se pueden usar juntos en una sola solicitud de scraping; seleccione uno de ellos. Usar ambos simultáneamente puede provocar conflictos o un comportamiento inesperado.
Operadores avanzados de búsqueda de Google
Al extraer, puede resultar útil combinar los operadores avanzados de búsqueda de Google con su consulta. Esto le permite personalizar el alcance de la búsqueda, garantizando que los resultados sean más relevantes y específicos. Explore estos comandos especiales aquí y aquí. Vea un ejemplo a continuación.
Localización
Adapte los resultados de búsqueda a ubicaciones geográficas e idiomas específicos.
geo_location
La ubicación geográfica para la que se debe adaptar el resultado. Usar este parámetro correctamente es extremadamente importante para obtener los datos correctos. Para obtener más información, lea sobre nuestras geo_location estructuras de parámetros aquí.
-
locale
Accept-Language valor del encabezado que cambia el idioma de la interfaz web de su página de búsqueda de Google. Más información.
-
Paginación
Controles para gestionar la paginación y la recuperación de resultados de búsqueda.
start_page
Número de la página inicial.
1
pages
Número de páginas a recuperar.
1
limit
Número de resultados a recuperar en cada página.
10
context:
limit_per_page
Si desea extraer varias páginas con la misma dirección IP, incluya un arreglo JSON y especifique los números de página usando la clave page También debe indicar el número de resultados orgánicos en cada página añadiendo una limit clave. Ver ejemplo.
-
Límite por página
Para usar esta función, incluya un arreglo JSON con objetos JSON que contengan los siguientes datos:
page
El número de la página que desea extraer. Cualquier valor entero mayor que 0 funcionará
1
limit
El número de resultados en la página en cuestión. Cualquier valor entero entre 1 y 100 (incluido) funcionará.
90
Muestra de solicitud
Filtrado
Opciones para filtrar y refinar los resultados de búsqueda según varios criterios.
context:safe_search
Búsqueda segura. Establécelo en true para activarlo.
false
context:
tbs
tbs parámetro. Este parámetro es como un contenedor para parámetros de Google más específicos, como limitar/ordenar resultados por fecha, así como otros filtros, algunos de los cuales dependen del tbm parámetro (p. ej. tbs=app_os:1 está disponible solo con tbm valor app). Más información aquí.
-
Otros
Configuraciones y controles avanzados adicionales para requisitos especializados.
context:
nfpr
true desactivará la autocorrección ortográfica
false
Parámetros de contexto
Todos los parámetros de contexto deben agregarse al context arreglo como objetos con clave y valor pares, p. ej.:
Datos estructurados
SERP Scraper API es capaz de extraer un objeto HTML o JSON que contiene resultados de búsqueda de Google, ofreciendo datos estructurados sobre varios elementos de la página de resultados.
Diccionario de datos de salida
Ejemplo HTML

Estructura JSON
La salida estructurada de Google News Search incluye campos como URL, page, results, y otros. La tabla siguiente presenta una lista detallada de cada función SERP que analizamos, junto con su descripción y tipo de dato. La tabla también incluye algunos metadatos.
url
La URL de la página de búsqueda de Google.
cadena
results
Un diccionario que contiene los resultados de la búsqueda.
arreglo
results.main
Una lista de resultados de noticias no pagados con sus detalles respectivos.
arreglo
results.additional
Una lista de artículos de tendencia con sus detalles respectivos.
objeto
results.total_results_count
El número total de resultados encontrados para la consulta de búsqueda.
arreglo
parse_status_code
El código de estado del trabajo de análisis. Puedes ver los códigos de estado del analizador descritos aquí.
entero
created_at
La marca de tiempo en que se creó el trabajo de scraping.
marca de tiempo
updated_at
La marca de tiempo en que se terminó el trabajo de scraping.
marca de tiempo
page
Número de página relativo a la paginación de Google SERP.
entero
job_id
El ID del trabajo asociado con el trabajo de scraping.
cadena
status_code
El código de estado del trabajo de scraping. Puedes ver los códigos de estado del scraper descritos aquí.
entero
Principal
Muestra una lista de resultados de noticias no pagados, proporcionando detalles relevantes para cada artículo.

url
La URL al artículo completo.
cadena
desc
Un breve fragmento del artículo completo.
cadena
title
El título del artículo.
cadena
source
El nombre del sitio web donde se publica el artículo.
cadena
pos_overall
Indica la posición general del resultado dentro de los resultados principales de News SERP.
entero
relative_publish_date
Describe hace cuánto se publicó el artículo.
cadena
Adicional
Presenta una lista de artículos de tendencia, acompañada de detalles relevantes.

items
Una lista de artículos con sus detalles respectivos.
arreglo
items.pos
Un indicador único que denota la posición del artículo en la lista.
entero
items.url
La URL al artículo completo.
cadena
items.title
El título del artículo.
cadena
items.source
El nombre del sitio web donde se publica el artículo.
cadena
items.relative_publish_date
Describe hace cuánto se publicó el artículo.
cadena
pos_overall
Indica la posición general del resultado dentro de los resultados adicionales de News SERP.
entero
section_title
El nombre de la sección adicional.
cadena
Última actualización
¿Te fue útil?

