LlamaIndex
Aprovecha la integración de LlamaIndex con Oxylabs Web Scraper API para ingerir contenido en línea fácilmente y crear flujos de trabajo impulsados por LLM.
La integración de LlamaIndex con el Oxylabs Web Scraper API te permite extraer y procesar datos web mediante un LLM (Modelo de lenguaje grande) en el mismo flujo de trabajo.
Descripción general
LlamaIndex es un framework de datos diseñado para crear aplicaciones LLM con fuentes de datos externas. Úsalo con Oxylabs Web Scraper API para:
Extraer datos estructurados sin tener que lidiar con CAPTCHAs, bloqueos de IP o renderizado de JS
Procesar resultados con un LLM en la misma canalización
Crear flujos de trabajo de extremo a extremo, desde la extracción hasta la salida impulsada por IA
Primeros pasos
Crea tus credenciales de usuario de API: regístrate para una prueba gratuita o compra el producto en el panel de Oxylabs para crear tus credenciales de usuario de API (USERNAME y PASSWORD).
Configuración del entorno
En esta guía usaremos el lenguaje de programación Python. Instala las bibliotecas requeridas usando pip:
pip install -qU llama-index llama-index-readers-oxylabs llama-index-readers-webCrea un .env archivo en el directorio de tu proyecto con tus credenciales de Oxylabs Web Scraper API y tu clave API de OpenAI:
OXYLABS_USERNAME=your_API_username
OXYLABS_PASSWORD=your_API_password
OPENAI_API_KEY=your-openai-keyCarga estas variables de entorno en tu script de Python:
Métodos de integración
Hay dos formas de acceder al contenido web a través de Web Scraper API en LlamaIndex:
Lector de Oxylabs
El llama-index-readers-oxylabs módulo contiene clases específicas que te permiten extraer datos de varias fuentes:
Búsqueda web de Google
OxylabsGoogleSearchReader
Anuncios de búsqueda de Google
OxylabsGoogleAdsReader
Producto de Amazon
OxylabsAmazonProductReader
Búsqueda de Amazon
OxylabsAmazonSearchReader
Reseñas de Amazon
OxylabsAmazonReviewsReader
Por ejemplo, puedes extraer resultados de búsqueda de Google:
Lector web de Oxylabs
Con la OxylabsWebReader clase, puedes extraer datos de cualquier URL:
Creación de un agente básico de búsqueda con IA
A continuación, se muestra un ejemplo de un agente de IA simple que puede buscar en Google y responder preguntas:
Configuración avanzada
Manejo de contenido dinámico
La Web Scraper API puede manejar el renderizado de JavaScript:
Configuración del tipo de user agent
Puedes especificar diferentes user agents:
Uso de parámetros específicos del objetivo
Muchos scrapers específicos del objetivo admiten parámetros adicionales:
Creación de índices vectoriales
LlamaIndex es especialmente útil para crear índices vectoriales a partir de contenido web:
Última actualización
¿Te fue útil?

