For the complete documentation index, see llms.txt. This page is also available as Markdown.

Guia de scraping para IA

Aprenda a obter dados do YouTube para treinamento de IA usando a Web Scraper API. Saiba mais sobre o fluxo de trabalho completo, da busca por vídeos à criação de um banco de dados.

Este guia vai orientá-lo pelo fluxo de trabalho para coletar e filtrar dados do YouTube para fins de treinamento de IA usando fontes especializadas do Web Scraper API: youtube_search, youtube_video_trainability, youtube_metadata, youtube_download, youtube_subtitles.

Etapa 1: Pesquisar vídeos

Comece pesquisando vídeos relacionados ao seu tópico de interesse.

Pesquisa básica

Para uma pesquisa rápida que retorna até 20 resultados:

{
  "source": "youtube_search",
  "query": "termo de pesquisa"
}

Pesquisa estendida

Para resultados mais abrangentes (até 700 resultados):

{
  "source": "youtube_search_max",
  "query": "termo de pesquisa"
}

Pesquisar com filtros

Refine sua pesquisa com filtros:

Use os filtros apropriados para restringir os resultados com base nas suas necessidades específicas. As opções incluem tipo de conteúdo (vídeo, canal, playlist), duração, data de envio e configurações de qualidade.

Etapa 2: Extrair IDs de vídeo dos resultados da pesquisa

Após receber os resultados da pesquisa, extraia os IDs de vídeo para processamento posterior. Na resposta de youtube_search ou youtube_search_max, os IDs de vídeo estão disponíveis diretamente no campo videoId de cada item de resultado, como mostrado neste trecho de resposta de exemplo:

Extraia esses IDs de vídeo para uma lista para uso nas chamadas de API subsequentes.

Etapa 3: Verificar elegibilidade para treinamento de IA

Antes de baixar ou usar vídeos para treinamento de IA, verifique a elegibilidade deles:

A resposta indicará se o vídeo pode ser usado para fins de treinamento de IA:

  • ["all"] - Treinamento permitido para todas as partes

  • ["none"] - Nenhum treinamento permitido para qualquer parte

  • ["party1", "party2", ...] - Treinamento permitido apenas para partes específicas

Etapa 4: Obter metadados do vídeo

Colete informações adicionais sobre os vídeos para avaliar melhor a qualidade e a relevância deles:

A resposta conterá metadados como contagem de visualizações, comentários, avaliações e outras métricas que podem ajudar você a avaliar a qualidade do conteúdo.

Etapa 5: Recuperar conteúdo dos vídeos selecionados

Depois de identificar vídeos de alta qualidade e treináveis com base na elegibilidade e nos metadados, você pode prosseguir com a recuperação do conteúdo. Isso pode ser feito em duas etapas paralelas:

5.1 Baixar conteúdo de vídeo/áudio

Opções adicionais para download:

Esta fonte está disponível apenas por meio da integração assíncrona Push-Pull e do recurso Armazenamento em Nuvem .

Observação:

  • Os vídeos podem ter até 3 horas de duração

  • A resolução padrão é 720p (pode ser personalizada)

  • Você pode especificar apenas áudio, apenas vídeo ou ambos

5.2 Recuperar legendas do vídeo

Verificando se um vídeo tem legendas (manualmente):

No YouTube, clique no ícone CC abaixo do vídeo para ativar as legendas/closed captions.

Se você quiser selecionar legendas em um idioma específico, procure o Configurações ícone ao lado do CC ícone, clique nele e vá para "Subtitles/CC" nas opções. Lá você encontrará Tradução automática, clique nele e você será levado à lista de idiomas.

Se as legendas estiverem disponíveis, você pode recuperá-las com:

Para vídeos com legendas criadas manualmente, especifique:

Processamento em lote

Para processar várias vídeos com eficiência, use endpoints em lote:

Melhores práticas

  1. Siga o fluxo de descoberta de search → trainability → metadata → content para maximizar a eficiência

  2. Refine os resultados da pesquisa antes de processar vídeos individuais

  3. Sempre verifique a elegibilidade para treinamento antes de usar conteúdo para IA

  4. Verifique códigos de resposta e implemente novas tentativas para requisições com falha

Atualizado

Isto foi útil?