For the complete documentation index, see llms.txt. This page is also available as Markdown.

Búsqueda de noticias

Extrae resultados de Google News a gran escala y obtén datos completamente analizados. Extrae artículos con títulos, fuentes y fechas de publicación.

La google_search la fuente está diseñada para recuperar resultados de Google Search (SERPs). Esta subpágina presenta específicamente datos relacionados con Google News Search. Para explorar otros tipos de resultados, lea aquí: Búsqueda web, Búsqueda de imágenes.

Explorar salida diccionario de datos para cada función SERP de News, ofreciendo una breve descripción, captura de pantalla, fragmento de código JSON analizado y una tabla que define cada campo analizado. Navegue por los detalles usando la navegación del lado derecho o desplazándose hacia abajo en la página.

Ejemplos de solicitud

En los ejemplos siguientes, hacemos una solicitud para obtener páginas de resultados de búsqueda de News para el término de búsqueda adidas.

udm

curl 'https://realtime.oxylabs.io/v1/queries' \\
--user 'USERNAME:PASSWORD' \\
-H 'Content-Type: application/json' \\
-d '{
        "source": "google_search",
        "query": "adidas",
        "parse": true,
        "context": [
            {
                "key": "udm",
                "value": 12
            }
        ]
    }'
import requests
from pprint import pprint

# Structure payload.
payload = {
    'source': 'google_search',
    'query': 'adidas',
    'parse': True,
    'context': [
        {'key': 'udm', 'value': 12},
    ],
}

# Get response.
response = requests.post(
    'https://realtime.oxylabs.io/v1/queries',
    auth=('USERNAME', 'PASSWORD'),
    json=payload,
)

# Print prettified response to stdout.
pprint(response.json())

tbm

Usamos el método de integración síncrono Realtime en nuestros ejemplos. Si desea usar Proxy Endpoint o asíncrona Push-Pull integración, consulte la sección de métodos de integración .

Valores de los parámetros de solicitud

Genérico

Opciones básicas de configuración y personalización para extraer resultados de búsqueda de Google News.

Parámetro
Descripción
Valor predeterminado

source

Establece el scraper. Use google_search.

query

La palabra clave o frase a buscar.

context: udm

Para obtener resultados de búsqueda de News, establezca el valor en 12. Encuentre otros valores aceptados aquí.

context: tbm

Para obtener resultados de búsqueda de News, establezca el valor en nws. Los otros valores aceptados son: app, blg, bks, dsc, isch, pts, plcs, rcp, lcl

render

Establecer html es obligatorio para esta fuente. Más información.

parse

Devuelve datos analizados cuando se establece en true. Explorar salida diccionario de datos.

false

callback_url

URL de su endpoint de callback. Más información

user_agent_type

Tipo de dispositivo y navegador. La lista completa se puede encontrar aquí.

desktop

- parámetro obligatorio

Operadores avanzados de búsqueda de Google

Al extraer, puede resultar útil combinar los operadores avanzados de búsqueda de Google con su consulta. Esto le permite personalizar el alcance de la búsqueda, garantizando que los resultados sean más relevantes y específicos. Explore estos comandos especiales aquí y aquí. Vea un ejemplo a continuación.

Localización

Adapte los resultados de búsqueda a ubicaciones geográficas e idiomas específicos.

Parámetro
Descripción
Valor predeterminado

geo_location

La ubicación geográfica para la que se debe adaptar el resultado. Usar este parámetro correctamente es extremadamente importante para obtener los datos correctos. Para obtener más información, lea sobre nuestras geo_location estructuras de parámetros aquí.

-

locale

Accept-Language valor del encabezado que cambia el idioma de la interfaz web de su página de búsqueda de Google. Más información.

-

Paginación

Controles para gestionar la paginación y la recuperación de resultados de búsqueda.

Parámetro
Descripción
Valor predeterminado

start_page

Número de la página inicial.

1

pages

Número de páginas a recuperar.

1

limit

Número de resultados a recuperar en cada página.

10

context:

limit_per_page

Si desea extraer varias páginas con la misma dirección IP, incluya un arreglo JSON y especifique los números de página usando la clave page También debe indicar el número de resultados orgánicos en cada página añadiendo una limit clave. Ver ejemplo.

-

Límite por página

Para usar esta función, incluya un arreglo JSON con objetos JSON que contengan los siguientes datos:

Parámetro
Descripción
Ejemplo

page

El número de la página que desea extraer. Cualquier valor entero mayor que 0 funcionará

1

limit

El número de resultados en la página en cuestión. Cualquier valor entero entre 1 y 100 (incluido) funcionará.

90

Muestra de solicitud

Filtrado

Opciones para filtrar y refinar los resultados de búsqueda según varios criterios.

Parámetro
Descripción
Valor predeterminado

context:safe_search

Búsqueda segura. Establécelo en true para activarlo.

false

context: tbs

tbs parámetro. Este parámetro es como un contenedor para parámetros de Google más específicos, como limitar/ordenar resultados por fecha, así como otros filtros, algunos de los cuales dependen del tbm parámetro (p. ej. tbs=app_os:1 está disponible solo con tbm valor app). Más información aquí.

-

Otros

Configuraciones y controles avanzados adicionales para requisitos especializados.

Parámetro
Descripción
Valor predeterminado

context: nfpr

true desactivará la autocorrección ortográfica

false

Parámetros de contexto

Todos los parámetros de contexto deben agregarse al context arreglo como objetos con clave y valor pares, p. ej.:

Datos estructurados

SERP Scraper API es capaz de extraer un objeto HTML o JSON que contiene resultados de búsqueda de Google, ofreciendo datos estructurados sobre varios elementos de la página de resultados.

google_search salida estructurada de noticias

Solo analizamos resultados de búsqueda de noticias para desktop búsquedas.

Diccionario de datos de salida

Ejemplo HTML

Estructura JSON

La salida estructurada de Google News Search incluye campos como URL, page, results, y otros. La tabla siguiente presenta una lista detallada de cada función SERP que analizamos, junto con su descripción y tipo de dato. La tabla también incluye algunos metadatos.

El número de elementos y campos para un tipo de resultado específico puede variar según la consulta de búsqueda.

Clave
Descripción
Tipo

url

La URL de la página de búsqueda de Google.

cadena

results

Un diccionario que contiene los resultados de la búsqueda.

arreglo

results.main

Una lista de resultados de noticias no pagados con sus detalles respectivos.

arreglo

results.additional

Una lista de artículos de tendencia con sus detalles respectivos.

objeto

results.total_results_count

El número total de resultados encontrados para la consulta de búsqueda.

arreglo

parse_status_code

El código de estado del trabajo de análisis. Puedes ver los códigos de estado del analizador descritos aquí.

entero

created_at

La marca de tiempo en que se creó el trabajo de scraping.

marca de tiempo

updated_at

La marca de tiempo en que se terminó el trabajo de scraping.

marca de tiempo

page

Número de página relativo a la paginación de Google SERP.

entero

job_id

El ID del trabajo asociado con el trabajo de scraping.

cadena

status_code

El código de estado del trabajo de scraping. Puedes ver los códigos de estado del scraper descritos aquí.

entero

En las siguientes secciones, los fragmentos de código JSON analizados se acortan cuando hay disponible más de un elemento para el tipo de resultado.

Principal

Muestra una lista de resultados de noticias no pagados, proporcionando detalles relevantes para cada artículo.

Clave (results.main)
Descripción
Tipo

url

La URL al artículo completo.

cadena

desc

Un breve fragmento del artículo completo.

cadena

title

El título del artículo.

cadena

source

El nombre del sitio web donde se publica el artículo.

cadena

pos_overall

Indica la posición general del resultado dentro de los resultados principales de News SERP.

entero

relative_publish_date

Describe hace cuánto se publicó el artículo.

cadena

Adicional

Presenta una lista de artículos de tendencia, acompañada de detalles relevantes.

Clave (results.additional)
Descripción
Tipo

items

Una lista de artículos con sus detalles respectivos.

arreglo

items.pos

Un indicador único que denota la posición del artículo en la lista.

entero

items.url

La URL al artículo completo.

cadena

items.title

El título del artículo.

cadena

items.source

El nombre del sitio web donde se publica el artículo.

cadena

items.relative_publish_date

Describe hace cuánto se publicó el artículo.

cadena

pos_overall

Indica la posición general del resultado dentro de los resultados adicionales de News SERP.

entero

section_title

El nombre de la sección adicional.

cadena

Última actualización

¿Te fue útil?