LLMs e IA
Encuentra guías de scraping de Oxylabs Web Scraper API para los LLMs y plataformas de IA más populares.
Los scrapers LLM de Oxylabs te permiten enviar prompts a plataformas de IA líderes y recibir respuestas estructuradas y analizadas. Objetivos compatibles:
ChatGPT – fuente:
chatgptGemini – fuente:
geminiPerplexity – fuente:
perplexity
Todos los scrapers dedicados de LLM e IA admiten instrucciones personalizadas del navegador. Más información.
Método de integración
Las fuentes de LLM e IA usan el Push-Pull método de integración. En lugar de mantener la conexión abierta hasta que la respuesta esté lista, envías un trabajo y recoges el resultado una vez que termina:
Enviar el trabajo: envía tu prompt al endpoint Push-Pull. Recibes de vuelta un ID de trabajo de inmediato, no el resultado.
Espera a que termine: o bien déjanos notificarte con
callback_url(recomendado), o comprueba el estado del trabajo por tu cuenta.Recupera el resultado: una vez que el estado sea
done, obtén la respuesta analizada.
Solicitar ejemplo
Todos los objetivos LLM usan en su mayoría los mismos parámetros de solicitud, con la principal diferencia en la longitud máxima del prompt.
Envía el payload al endpoint Push-Pull – consulta las páginas individuales de cada objetivo para ver ejemplos completos de código.
{
"source": "chatgpt",
"prompt": "best supplements for better sleep",
"parse": true,
"geo_location": "United States",
"callback_url": "https://your-server.com/oxylabs-callback"
}source
El objetivo LLM a extraer. Valores permitidos: chatgpt, perplexity, gemini.
cadena
prompt
Consulta o prompt para enviar. Longitud máxima: 4.000 caracteres para chatgpt; 8.000 caracteres para perplexity y gemini.
cadena
callback_url
Recomendado. URL donde entregamos una notificación una vez que el trabajo se completa, para que no tengas que comprobar el estado tú mismo. Más información.
cadena
parse
Establécelo en true para recibir una respuesta JSON estructurada.
booleano
geo_location
Ubicación geográfica desde la que enrutar la solicitud (p. ej., "United States").
cadena
browser_instructions
Ejecuta instrucciones personalizadas opcionales del navegador al renderizar JavaScript. Más información.
objeto
- parámetro obligatorio
Nota: La renderización de JavaScript está habilitada por defecto para todos los objetivos LLM. No incluyas render en tu payload de solicitud.
Respuesta
Todos los objetivos LLM devuelven la misma estructura de datos de nivel superior. (consulta las páginas individuales de cada objetivo para ver la referencia completa de campos de respuesta).
Envío del trabajo
Al enviarlo se devuelven los detalles del trabajo, incluido el ID que usarás para recoger el resultado. No contiene los datos extraídos.
job.id
Identificador único del trabajo de scraping. Úsalo para recuperar el resultado.
cadena
job.status
Estado actual del trabajo: pendiente mientras se ejecuta, done cuando el resultado está listo, faulted si falló (recupera el resultado solo una vez que el estado sea done)
cadena
job.source
Enviado source valor.
cadena
job.parse
Enviado parse valor.
booleano
job.prompt
Prompt original en la solicitud.
cadena
job.geo_location
Geolocalización usada para la solicitud.
cadena
job.created_at
Marca temporal de creación del trabajo (UTC, YYYY-MM-DD HH:MM:SS).
cadena
job.updated_at
Marca temporal de actualización del trabajo.
cadena
Recuperación de resultados
Una vez que el estado del trabajo sea done, recupera el resultado usando el job.id que recibiste. El contenido analizado específico de cada objetivo se encuentra dentro de results[].content (consulta las páginas individuales de cada objetivo para ver la referencia completa de campos).
results[].job_id
ID de trabajo asociado al resultado.
cadena
results[].status_code
Código de estado HTTP de la obtención de la página.
entero
results[].url
Página LLM de destino.
cadena
results[].content
Datos de respuesta LLM. Los campos varían según el objetivo.
objeto
Datos de respuesta por objetivo
La tabla siguiente muestra qué campos de datos están disponibles para cada objetivo LLM.
Entrada del prompt
✓
✓
✓
Salida analizada (JSON)
✓
✓
✓
Respuesta en texto plano
✓
✓
–
Salida Markdown
✓
✓
✓
Árbol JSON de Markdown
✓
–
✓
Búsqueda / consultas relacionadas
✓
–
✓
Citas / fuentes
✓
✓
✓
Resultados de compras
✓
–
✓
Anuncios
✓
–
–
Geolocalización
✓
✓
✓
Modelo LLM utilizado
✓
✓
✓
– condicional, devuelto solo cuando el contenido está en la respuesta del LLM.
Última actualización
¿Te fue útil?

