Guia de scraping para IA
Aprenda a obter dados do YouTube para treinamento de IA usando Web Scraper API. Saiba mais sobre o fluxo de trabalho completo, da busca por vídeos à criação de um banco de dados.
Este guia orientará você sobre o fluxo de trabalho para coletar e filtrar dados do YouTube para fins de treinamento de IA usando fontes especializadas da Web Scraper API: youtube_search, youtube_video_trainability, youtube_metadata, youtube_download, youtube_subtitles.
Etapa 1: Pesquisar vídeos
Comece pesquisando vídeos relacionados ao seu tópico de interesse.
Pesquisa básica
Para uma pesquisa rápida que retorna até 20 resultados:
{
"source": "youtube_search",
"query": "your search term"
}Pesquisa estendida
Para resultados mais abrangentes (até 700 resultados):
{
"source": "youtube_search_max",
"query": "your search term"
}Pesquisar com filtros
Refine sua pesquisa com filtros:
Etapa 2: Extrair IDs de vídeo dos resultados da pesquisa
Após receber os resultados da pesquisa, extraia os IDs de vídeo para processamento adicional. Na resposta de youtube_search ou youtube_search_max, os IDs de vídeo estão disponíveis diretamente no videoId campo de cada item de resultado, como mostrado neste trecho de resposta de exemplo:
Extraia esses IDs de vídeo em uma lista para uso em chamadas de API subsequentes.
Etapa 3: Verificar a elegibilidade para treinamento de IA
Antes de baixar ou usar vídeos para treinamento de IA, verifique a elegibilidade deles:
A resposta indicará se o vídeo pode ser usado para fins de treinamento de IA:
["all"]- Treinamento permitido para todas as partes["none"]- Nenhum treinamento permitido para qualquer parte["party1", "party2", ...]- Treinamento permitido apenas para partes específicas
Etapa 4: Obter metadados de vídeo
Colete informações adicionais sobre os vídeos para avaliar melhor sua qualidade e relevância:
A resposta conterá metadados como contagens de visualizações, comentários, avaliações e outras métricas que podem ajudar você a avaliar a qualidade do conteúdo.
O parse o parâmetro deve ser definido como verdadeiro para a fonte de metadados.
Etapa 5: Recuperar conteúdo dos vídeos selecionados
Após identificar vídeos de alta qualidade e adequados para treinamento com base em sua elegibilidade e metadados, você pode prosseguir com a recuperação de conteúdo. Isso pode ser feito em duas etapas paralelas:
5.1 Baixar conteúdo de vídeo/áudio
Opções adicionais para download:
Observação:
Os vídeos podem ter até 3 horas de duração
A resolução padrão é 720p (pode ser personalizada)
Você pode especificar apenas áudio, apenas vídeo ou ambos
5.2 Recuperar legendas de vídeo
Verificando se um vídeo tem legendas (manualmente):
No YouTube, clique no ícone CC abaixo do vídeo para ativar as legendas.
Se quiser selecionar legendas em um idioma específico, procure o ícone Configurações ao lado do ícone CC , clique nele e acesse "Subtitles/CC" nas opções. Lá você encontrará Tradução automática, clique nela e você será direcionado à lista de idiomas.
Se as legendas estiverem disponíveis, você poderá recuperá-las com:
Para vídeos com legendas criadas manualmente, especifique:
Processamento em lote
Para o processamento eficiente de vários vídeos, use endpoints em lote:
Boas práticas
Siga o fluxo de descoberta de pesquisa → treinabilidade → metadados → conteúdo para maximizar a eficiência
Restrinja os resultados da pesquisa antes de processar vídeos individuais
Sempre verifique a treinabilidade antes de usar conteúdo para IA
Verifique códigos de resposta e implemente tentativas novamente para solicitações com falha
Atualizado
Isto foi útil?

