Guía de scraping para IA
Aprende a obtener datos de YouTube para entrenamiento de IA usando Web Scraper API. Descubre más sobre el flujo de trabajo completo, desde buscar videos hasta crear una base de datos.
Esta guía le mostrará el flujo de trabajo para recopilar y filtrar datos de YouTube con fines de entrenamiento de IA usando las fuentes especializadas de Web Scraper API: youtube_search, youtube_video_trainability, youtube_metadata, youtube_download, youtube_subtitles.
Paso 1: Buscar videos
Empiece buscando videos relacionados con su tema de interés.
Búsqueda básica
Para una búsqueda rápida que devuelve hasta 20 resultados:
{
"source": "youtube_search",
"query": "your search term"
}Búsqueda ampliada
Para resultados más completos (hasta 700 resultados):
{
"source": "youtube_search_max",
"query": "your search term"
}Buscar con filtros
Refine su búsqueda con filtros:
Paso 2: Extraer los IDs de video de los resultados de búsqueda
Después de recibir los resultados de búsqueda, extraiga los IDs de video para su procesamiento posterior. En la respuesta de youtube_search o youtube_search_max, los IDs de video están disponibles directamente en el videoId campo de cada elemento de resultado, como se muestra en este fragmento de respuesta de ejemplo:
Extraiga estos IDs de video en una lista para usarlos en llamadas posteriores a la API.
Paso 3: Comprobar la elegibilidad para entrenamiento de IA
Antes de descargar o usar videos para entrenamiento de IA, compruebe su elegibilidad:
La respuesta indicará si el video puede usarse con fines de entrenamiento de IA:
["all"]- Entrenamiento permitido para todas las partes["none"]- No se permite entrenamiento para ninguna parte["party1", "party2", ...]- Entrenamiento permitido solo para partes específicas
Paso 4: Obtener metadatos del video
Recopile información adicional sobre los videos para evaluar mejor su calidad y relevancia:
La respuesta contendrá metadatos como número de visualizaciones, comentarios, calificaciones y otras métricas que pueden ayudarle a evaluar la calidad del contenido.
La parse el parámetro debe establecerse en true para la fuente de metadatos.
Paso 5: Recuperar contenido de los videos seleccionados
Después de identificar videos de alta calidad y aptos para entrenamiento según su elegibilidad y metadatos, puede proceder con la recuperación de contenido. Esto puede hacerse en dos pasos en paralelo:
5.1 Descargar contenido de video/audio
Opciones adicionales para la descarga:
Nota:
Los videos pueden durar hasta 3 horas
La resolución predeterminada es 720p (se puede personalizar)
Puede especificar solo audio, solo video o ambos
5.2 Recuperar subtítulos de video
Comprobación manual de si un video tiene subtítulos:
En YouTube, haga clic en el CC icono debajo del video para activar los subtítulos.
Si desea seleccionar subtítulos en un idioma específico, busque el Configuración icono junto al CC icono, haga clic en él y vaya a "Subtítulos/CC" en las opciones. Allí encontrará Traducción automática, haga clic en esa opción y le llevará a la lista de idiomas.
Si los subtítulos están disponibles, puede recuperarlos con:
Para videos con subtítulos creados manualmente, especifique:
Procesamiento por lotes
Para un procesamiento eficiente de múltiples videos, use endpoints por lotes:
Buenas prácticas
Siga el flujo de descubrimiento desde búsqueda → entrenabilidad → metadatos → contenido para maximizar la eficiencia
Reduzca los resultados de búsqueda antes de procesar videos individuales
Verifique siempre la entrenabilidad antes de usar contenido para IA
Compruebe códigos de respuesta e implemente reintentos para las solicitudes fallidas
Última actualización
¿Te fue útil?

