Busca de notícias
Raspe resultados do Google News em grande escala e obtenha dados totalmente parseados. Extraia artigos com títulos, fontes e datas de publicação.
A google_search A fonte google_search foi projetada para recuperar resultados da Pesquisa Google (SERPs). Esta subpágina apresenta especificamente dados relacionados à Pesquisa Google News. Para explorar outros tipos de resultado, leia aqui: Pesquisa na web, Pesquisa de imagens.
Para coletar a pesquisa do Google News, inclua o context:udm parâmetro com o valor definido como 12 ou context:tbm parâmetro com o valor definido como nws.
Exemplos de requisição
Nos exemplos abaixo, fazemos uma requisição para obter páginas de resultados da pesquisa News para o termo de busca adidas.
udm
curl 'https://realtime.oxylabs.io/v1/queries' \
--user 'USERNAME:PASSWORD' \
-H 'Content-Type: application/json' \
-d '{
"source": "google_search",
"query": "adidas",
"parse": true,
"context": [
{
"key": "udm",
"value": 12
}
]
}'import requests
from pprint import pprint
# Structure payload.
payload = {
'source': 'google_search',
'query': 'adidas',
'parse': True,
'context': [
{'key': 'udm', 'value': 12},
],
}
# Get response.
response = requests.post(
'https://realtime.oxylabs.io/v1/queries',
auth=('USERNAME', 'PASSWORD'),
json=payload,
)
# Print prettified response to stdout.
pprint(response.json())tbm
Usamos o método de integração síncrona Realtime em nossos exemplos. Se você quiser usar Proxy Endpoint ou assíncrona Push-Pull integração, consulte a seção de métodos de integração .
Valores dos parâmetros de requisição
Geral
Opções básicas de configuração e personalização para coletar resultados da pesquisa do Google News.
source
Define o scraper. Use google_search.
–
query
A palavra-chave ou frase a ser pesquisada.
–
context:
udm
Para obter resultados da pesquisa News, defina o valor como 12. Encontre outros valores aceitos aqui.
–
context:
tbm
Para obter resultados da pesquisa News, defina o valor como nws. Outros valores aceitos são: app, blg, bks, dsc, isch, pts, plcs, rcp, lcl
–
- parâmetro obrigatório
Observação: udm e tbm os parâmetros context não podem ser usados juntos em uma única requisição de scraping; selecione um deles. Usar ambos simultaneamente pode levar a conflitos ou comportamento inesperado.
Operadores avançados de pesquisa do Google
Ao coletar, pode ser útil combinar operadores avançados de pesquisa do Google com sua consulta. Isso permite personalizar o escopo da busca, garantindo que os resultados sejam mais relevantes e focados. Explore estes comandos especiais aqui e aqui. Veja um exemplo abaixo.
Localização
Adapte os resultados da busca para locais geográficos e idiomas específicos.
geo_location
A localização geográfica para a qual o resultado deve ser adaptado. Usar este parâmetro corretamente é extremamente importante para obter os dados corretos. Para mais informações, leia sobre nossas geo_location estruturas de parâmetros sugeridas aqui.
-
locale
Accept-Language valor do cabeçalho que altera o idioma da interface web da sua página de pesquisa do Google. Mais informações.
-
Paginação
Controles para gerenciar a paginação e a recuperação dos resultados de pesquisa.
start_page
Número da página inicial.
1
pages
Número de páginas a recuperar.
1
limit
Número de resultados a recuperar em cada página.
10
context:
limit_per_page
Se você quiser coletar várias páginas com o mesmo endereço IP, inclua um array JSON e especifique os números das páginas usando a page chave. Você também deve indicar o número de resultados orgânicos em cada página adicionando uma limit chave. Veja o exemplo.
-
Limite por página
Para usar este recurso, inclua um array JSON com objetos JSON contendo os seguintes dados:
page
O número da página que você gostaria de coletar. Qualquer valor inteiro maior que 0 funciona
1
limit
O número de resultados na página em questão. Qualquer valor inteiro entre 1 e 100 (inclusive) funciona.
90
Exemplo de requisição
Filtragem
Opções para filtrar e refinar os resultados da pesquisa com base em vários critérios.
context:safe_search
Pesquisa segura. Defina como true para ativá-la.
false
context:
tbs
tbs parâmetro. Esse parâmetro é como um contêiner para parâmetros mais obscuros do Google, como limitar/ordenar resultados por data, além de outros filtros, alguns dos quais dependem do tbm parâmetro (por exemplo, tbs=app_os:1 está disponível apenas com tbm valor app). Mais informações aqui.
-
Outros
Configurações e controles avançados adicionais para requisitos especializados.
context:
nfpr
true desativará a correção automática de ortografia
false
Parâmetros de contexto
Todos os parâmetros de contexto devem ser adicionados ao context array como objetos com chave e valor pares, por exemplo:
Dados estruturados
SERP Scraper API é capaz de extrair um objeto HTML ou JSON que contém resultados de pesquisa do Google, oferecendo dados estruturados sobre vários elementos da página de resultados.
Dicionário de dados de saída
Exemplo em HTML

Estrutura JSON
A saída estruturada da Pesquisa de Notícias do Google inclui campos como URL, page, results, e outros. A tabela abaixo apresenta uma lista detalhada de cada recurso de SERP que analisamos, juntamente com sua descrição e tipo de dado. A tabela também inclui alguns metadados.
url
A URL da página de pesquisa do Google.
cadeia de caracteres
results
Um dicionário contendo os resultados da pesquisa.
lista
results.main
Uma lista de resultados de notícias não pagos com seus respectivos detalhes.
lista
results.additional
Uma lista de artigos em destaque com seus respectivos detalhes.
objeto
results.total_results_count
O número total de resultados encontrados para a consulta de pesquisa.
lista
parse_status_code
O código de status do trabalho de análise. Você pode ver os códigos de status do analisador descritos aqui.
inteiro
created_at
O timestamp em que o trabalho de scraping foi criado.
carimbo de data/hora
updated_at
O timestamp em que o trabalho de scraping foi concluído.
carimbo de data/hora
page
Número da página relativo à paginação da SERP do Google.
inteiro
job_id
O ID do trabalho associado ao trabalho de scraping.
cadeia de caracteres
status_code
O código de status do trabalho de scraping. Você pode ver os códigos de status do scraper descritos aqui.
inteiro
Principal
Exibe uma lista de resultados de notícias não pagos, fornecendo detalhes relevantes de cada artigo.

url
A URL do artigo completo.
cadeia de caracteres
desc
Um breve trecho do artigo completo.
cadeia de caracteres
title
O título do artigo.
cadeia de caracteres
source
O nome do site onde o artigo é publicado.
cadeia de caracteres
pos_overall
Indica a posição geral do resultado dentro dos resultados principais da SERP de Notícias.
inteiro
relative_publish_date
Descreve há quanto tempo o artigo foi publicado.
cadeia de caracteres
Adicional
Apresenta uma lista de artigos em destaque, acompanhada de detalhes relevantes.

items
Uma lista de artigos com seus respectivos detalhes.
lista
items.pos
Um indicador único que denota a posição do artigo na lista.
inteiro
items.url
A URL do artigo completo.
cadeia de caracteres
items.title
O título do artigo.
cadeia de caracteres
items.source
O nome do site onde o artigo é publicado.
cadeia de caracteres
items.relative_publish_date
Descreve há quanto tempo o artigo foi publicado.
cadeia de caracteres
pos_overall
Indica a posição geral do resultado dentro dos resultados adicionais da SERP de Notícias.
inteiro
section_title
O nome da seção adicional.
cadeia de caracteres
Atualizado
Isto foi útil?

