AI 抓取指南
了解如何使用网页爬虫API 获取用于 AI 训练的 YouTube 数据。深入了解从搜索视频到创建数据库的完整工作流。
本指南将带你了解使用 网页爬虫API 的专用来源: youtube_search, youtube_video_trainability, youtube_metadata, youtube_download, youtube_subtitles.
步骤 1:搜索视频
先搜索与你感兴趣的主题相关的视频。
基础搜索
如需快速搜索,最多返回 20 个结果:
{
"source": "youtube_search",
"query": "your search term"
}扩展搜索
如需更全面的结果(最多 700 个结果):
{
"source": "youtube_search_max",
"query": "your search term"
}使用过滤条件搜索
使用过滤条件优化搜索:
步骤 2:从搜索结果中提取视频 ID
在收到搜索结果后,提取 视频 ID 用于进一步处理。在来自 youtube_search 或 youtube_search_max的响应中,video ID 直接位于 videoId 字段中,如下面的示例响应片段所示:
将这些视频 ID 提取到列表中,以便在后续 API 调用中使用。
步骤 3:检查 AI 训练资格
在下载或将视频用于 AI 训练之前,先检查其资格:
响应会指示该视频是否可用于 AI 训练:
["all"]- 允许所有方训练["none"]- 不允许任何方训练["party1", "party2", ...]- 仅允许特定方训练
步骤 4:获取视频元数据
收集更多视频信息,以进一步评估其质量和相关性:
响应将包含观看次数、评论、评分和其他指标等元数据,这些信息可帮助你评估内容质量。
该 解析 参数必须设置为 true ,用于元数据来源。
步骤 5:检索所选视频的内容
在根据其资格和元数据识别出高质量、可训练的视频后,即可进行内容检索。这可以分两个并行步骤完成:
5.1 下载视频/音频内容
下载的其他选项:
注意:
视频长度最长可达 3 小时
默认分辨率为 720p(可自定义)
你可以指定仅音频、仅视频或两者都要
5.2 检索视频字幕
手动检查视频是否有字幕:
在 YouTube 中,点击 CC 视频下方的图标可打开字幕/隐藏式字幕。
如果你想选择特定语言的字幕,请找到 设置 旁边的 CC 图标,点击它并进入 "字幕/CC" 选项。你会在那里找到 自动翻译,点击它后会进入语言列表。
如果字幕可用,你可以通过以下方式检索:
对于手动创建字幕的视频,请指定:
批量处理
如需高效处理多个视频,请使用批量端点:
最佳实践
遵循以下发现工作流: 搜索 → 可训练性 → 元数据 → 内容 以最大化效率
在处理单个视频之前先缩小搜索结果范围
在将内容用于 AI 之前,始终验证可训练性
检查 响应代码 并为失败的请求实现重试
最后更新于
这有帮助吗?

