For the complete documentation index, see llms.txt. This page is also available as Markdown.

LLMs e IA

Encuentra guías de scraping de Oxylabs Web Scraper API para los LLMs y plataformas de IA más populares.

Los scrapers LLM de Oxylabs te permiten enviar prompts a plataformas de IA líderes y recibir respuestas estructuradas y analizadas. Objetivos compatibles:

  • ChatGPT – fuente: chatgpt

  • Gemini – fuente: gemini

  • Perplexity – fuente: perplexity

Método de integración

Las fuentes de LLM e IA usan el Push-Pull método de integración. En lugar de mantener la conexión abierta hasta que la respuesta esté lista, envías un trabajo y recoges el resultado una vez que termina:

  1. Enviar el trabajo: envía tu prompt al endpoint Push-Pull. Recibes de vuelta un ID de trabajo de inmediato, no el resultado.

  2. Espera a que termine: o bien déjanos notificarte con callback_url (recomendado), o comprueba el estado del trabajo por tu cuenta.

  3. Recupera el resultado: una vez que el estado sea done, obtén la respuesta analizada.

Realtime y Proxy Endpoint no están disponibles para chatgpt, gemini, y perplexity fuentes. Estos objetivos tardan más en completarse de lo que permite una conexión síncrona, por lo que Push-Pull es el único método compatible.

Solicitar ejemplo

Todos los objetivos LLM usan en su mayoría los mismos parámetros de solicitud, con la principal diferencia en la longitud máxima del prompt.

Envía el payload al endpoint Push-Pull – consulta las páginas individuales de cada objetivo para ver ejemplos completos de código.

{
  "source": "chatgpt",
  "prompt": "best supplements for better sleep",
  "parse": true,
  "geo_location": "United States",
  "callback_url": "https://your-server.com/oxylabs-callback"
}
Parámetro
Descripción
Tipo

source

El objetivo LLM a extraer. Valores permitidos: chatgpt, perplexity, gemini.

cadena

prompt

Consulta o prompt para enviar. Longitud máxima: 4.000 caracteres para chatgpt; 8.000 caracteres para perplexity y gemini.

cadena

callback_url

Recomendado. URL donde entregamos una notificación una vez que el trabajo se completa, para que no tengas que comprobar el estado tú mismo. Más información.

cadena

parse

Establécelo en true para recibir una respuesta JSON estructurada.

booleano

geo_location

Ubicación geográfica desde la que enrutar la solicitud (p. ej., "United States").

cadena

browser_instructions

Ejecuta instrucciones personalizadas opcionales del navegador al renderizar JavaScript. Más información.

objeto

- parámetro obligatorio

Respuesta

Todos los objetivos LLM devuelven la misma estructura de datos de nivel superior. (consulta las páginas individuales de cada objetivo para ver la referencia completa de campos de respuesta).

Envío del trabajo

Al enviarlo se devuelven los detalles del trabajo, incluido el ID que usarás para recoger el resultado. No contiene los datos extraídos.

Campo
Descripción
Tipo

job.id

Identificador único del trabajo de scraping. Úsalo para recuperar el resultado.

cadena

job.status

Estado actual del trabajo: pendiente mientras se ejecuta, done cuando el resultado está listo, faulted si falló (recupera el resultado solo una vez que el estado sea done)

cadena

job.source

Enviado source valor.

cadena

job.parse

Enviado parse valor.

booleano

job.prompt

Prompt original en la solicitud.

cadena

job.geo_location

Geolocalización usada para la solicitud.

cadena

job.created_at

Marca temporal de creación del trabajo (UTC, YYYY-MM-DD HH:MM:SS).

cadena

job.updated_at

Marca temporal de actualización del trabajo.

cadena

Recuperación de resultados

Una vez que el estado del trabajo sea done, recupera el resultado usando el job.id que recibiste. El contenido analizado específico de cada objetivo se encuentra dentro de results[].content (consulta las páginas individuales de cada objetivo para ver la referencia completa de campos).

Campo
Descripción
Tipo

results[].job_id

ID de trabajo asociado al resultado.

cadena

results[].status_code

Código de estado HTTP de la obtención de la página.

entero

results[].url

Página LLM de destino.

cadena

results[].content

Datos de respuesta LLM. Los campos varían según el objetivo.

objeto

Datos de respuesta por objetivo

La tabla siguiente muestra qué campos de datos están disponibles para cada objetivo LLM.

ChatGPT

Gemini

Perplexity

Entrada del prompt

Salida analizada (JSON)

Respuesta en texto plano

Salida Markdown

Árbol JSON de Markdown

Búsqueda / consultas relacionadas

Citas / fuentes

Resultados de compras

Anuncios

Geolocalización

Modelo LLM utilizado

– condicional, devuelto solo cuando el contenido está en la respuesta del LLM.

Última actualización

¿Te fue útil?