LlamaIndex
Aproveite a integração do LlamaIndex com o Web Scraper API da Oxylabs para ingerir conteúdo online facilmente e criar fluxos de trabalho orientados por LLM.
A integração do LlamaIndex com o Oxylabs Web Scraper API permite que você extraia e processe dados da web por meio de um LLM (Large Language Model) no mesmo fluxo de trabalho.
Visão geral
LlamaIndex é um framework de dados projetado para criar aplicações LLM com fontes de dados externas. Use-o com Oxylabs Web Scraper API para:
Extraia dados estruturados sem lidar com CAPTCHAs, bloqueios de IP ou renderização de JS
Processe os resultados com um LLM no mesmo pipeline
Crie fluxos de trabalho completos, da extração à saída com IA
Como começar
Crie suas credenciais de usuário da API: cadastre-se para um teste gratuito ou compre o produto na painel da Oxylabs para criar suas credenciais de usuário da API (USERNAME e PASSWORD).
Configuração do ambiente
Neste guia, usaremos a linguagem de programação Python. Instale as bibliotecas necessárias usando pip:
pip install -qU llama-index llama-index-readers-oxylabs llama-index-readers-webCrie um .env arquivo no diretório do seu projeto com suas credenciais do Oxylabs Web Scraper API e a chave de API da OpenAI:
OXYLABS_USERNAME=your_API_username
OXYLABS_PASSWORD=your_API_password
OPENAI_API_KEY=your-openai-keyCarregue essas variáveis de ambiente no seu script Python:
Métodos de integração
Há duas maneiras de acessar conteúdo da web via Web Scraper API no LlamaIndex:
Leitor Oxylabs
O llama-index-readers-oxylabs módulo contém classes específicas que permitem extrair dados de várias fontes:
Pesquisa da Web do Google
OxylabsGoogleSearchReader
Anúncios da Pesquisa do Google
OxylabsGoogleAdsReader
Produto da Amazon
OxylabsAmazonProductReader
Pesquisa da Amazon
OxylabsAmazonSearchReader
Avaliações da Amazon
OxylabsAmazonReviewsReader
Por exemplo, você pode extrair resultados da Pesquisa Google:
Leitor Web da Oxylabs
Com a OxylabsWebReader classe, você pode extrair dados de qualquer URL:
Criando um agente básico de busca com IA
Abaixo está um exemplo de um agente de IA simples que pode pesquisar no Google e responder perguntas:
Configuração avançada
Como lidar com conteúdo dinâmico
O Web Scraper API pode lidar com a renderização de JavaScript:
Definindo o tipo de user agent
Você pode especificar diferentes user agents:
Usando parâmetros específicos do alvo
Muitos scrapers específicos do alvo aceitam parâmetros adicionais:
Criando índices vetoriais
LlamaIndex é particularmente útil para criar índices vetoriais a partir de conteúdo da web:
Atualizado
Isto foi útil?

