LangChain
将 LangChain 框架与 Oxylabs 网页爬虫API 结合使用,提取网页数据并将其输入 LLM 工作流——在一个流水线中完成收集、处理和分析。
该 LangChain 与以下内容集成 Oxylabs 网页爬虫API 使你能够在同一工作流中通过 LLM(大语言模型)收集和处理网页数据。
概述
LangChain 是一个用于构建将 LLM 与工具、API 和网页数据结合使用的应用的框架。它支持 Python 和 JavaScript。与以下内容一起使用: Oxylabs 网页爬虫API 结合使用以:
抓取结构化数据,无需处理 CAPTCHA、IP 封锁或 JS 渲染
在同一管道中使用 LLM 处理结果
构建从提取到 AI 驱动输出的端到端工作流
入门
创建你的 API 用户凭证: 注册免费试用或在以下位置购买产品 Oxylabs 控制面板 以创建您的 API 用户凭据(USERNAME 并 PASSWORD).
如果你的账户需要多个 API 用户,请联系我们的 客户支持 或通过我们的 24/7 在线聊天支持发送消息。
本指南将使用 Python 编程语言。使用 pip 安装所需的库:
pip install -qU langchain-oxylabs langchain-openai langgraph requests python-dotenv环境设置
在您的项目目录中创建一个 .env 在你的项目目录中创建一个包含 Oxylabs API 用户和 OpenAI 凭证的文件:
OXYLABS_USERNAME=your-username
OXYLABS_PASSWORD=your-password
OPENAI_API_KEY=your-openai-key在您的 Python 脚本中加载这些环境变量:
集成方法
将 Oxylabs 网页爬虫API 与 LangChain 集成主要有两种方式:
使用 langchain-oxylabs 包
对于 Google 搜索查询,请使用专用的 langchain-oxylabs 包,它提供开箱即用的集成:
使用网页爬虫API
对于访问除 Google 搜索之外的其他网站,你可以直接向网页爬虫API发送请求:
面向特定目标的抓取器
Oxylabs 提供 专用抓取器 用于各种常见网站。以下是一些可用源的示例:
google_search
query
Amazon
amazon_search
query, domain (可选)
Walmart
walmart_search
query
Target
target_search
query
Kroger
kroger_search
query, store_id
Staples
staples_search
query
要使用特定抓取器,请修改 scrape_website 函数中的 payload:
高级配置
处理动态内容
网页爬虫API 可以处理 JavaScript 渲染 通过添加 render 参数:
设置用户代理类型
你可以指定不同的 用户代理 来模拟不同设备:
使用目标特定参数
许多 面向特定目标的抓取器 支持额外参数:
错误处理
为生产环境应用实现适当的错误处理:
最后更新于
这有帮助吗?

