For the complete documentation index, see llms.txt. This page is also available as Markdown.

LlamaIndex

Aprovecha la integración de LlamaIndex con Oxylabs Web Scraper API para ingerir fácilmente contenido en línea y crear flujos de trabajo impulsados por LLM.

La integración de LlamaIndex con la Oxylabs Web Scraper API te permite extraer y procesar datos web mediante un LLM (modelo de lenguaje grande) en el mismo flujo de trabajo.

Descripción general

LlamaIndex es un marco de datos diseñado para crear aplicaciones LLM con fuentes de datos externas. Úsalo con Oxylabs Web Scraper API para:

  • Extraer datos estructurados sin gestionar CAPTCHAs, bloqueos de IP o renderizado de JS

  • Procesar resultados con un LLM en la misma canalización

  • Crear flujos de trabajo de extremo a extremo desde la extracción hasta la salida impulsada por IA

Primeros pasos

Crea tus credenciales de usuario de la API: regístrate para una prueba gratuita o compra el producto en la panel de Oxylabs para crear tus credenciales de usuario de API (USERNAME y PASSWORD).

Si necesitas más de un usuario de API para tu cuenta, contacta con nuestro servicio de atención al cliente o escribe a nuestro soporte por chat en vivo 24/7.

Configuración del entorno

En esta guía usaremos el lenguaje de programación Python. Instala las bibliotecas requeridas usando pip:

pip install -qU llama-index llama-index-readers-oxylabs llama-index-readers-web

Crea un .env archivo en el directorio de tu proyecto con tus credenciales de Oxylabs Web Scraper API y tu clave de API de OpenAI:

OXYLABS_USERNAME=your_API_username
OXYLABS_PASSWORD=your_API_password
OPENAI_API_KEY=your-openai-key

Carga estas variables de entorno en tu script de Python:

Métodos de integración

Hay dos formas de acceder al contenido web mediante Web Scraper API en LlamaIndex:

Lector de Oxylabs

La llama-index-readers-oxylabs El módulo contiene clases específicas que te permiten extraer datos de varias fuentes:

Fuente de datos de la API
Clase de lector

Búsqueda web de Google

OxylabsGoogleSearchReader

Anuncios de búsqueda de Google

OxylabsGoogleAdsReader

Producto de Amazon

OxylabsAmazonProductReader

Búsqueda de Amazon

OxylabsAmazonSearchReader

Reseñas de Amazon

OxylabsAmazonReviewsReader

Por ejemplo, puedes extraer resultados de búsqueda de Google:

Lector web de Oxylabs

Con la OxylabsWebReader clase, puedes extraer datos de cualquier URL:

Creación de un agente de búsqueda de IA básico

A continuación, se muestra un ejemplo de un agente de IA simple que puede buscar en Google y responder preguntas:

Configuración avanzada

Manejo de contenido dinámico

Web Scraper API puede manejar el renderizado de JavaScript:

Establecer el tipo de user agent

Puedes especificar diferentes agentes de usuario:

Uso de parámetros específicos del destino

Muchos scrapers específicos del destino admiten parámetros adicionales:

Creación de índices vectoriales

LlamaIndex es especialmente útil para crear índices vectoriales a partir de contenido web:

Última actualización

¿Te fue útil?