DATOS ABIERTOS
LAION lanza dataset de 10 millones de horas de video para entrenar modelos de IA
El dataset Big Video Dataset (BVD) contiene 55 millones de clips con descripciones de audio y video generadas automáticamente, más 300 millones de imágenes. Modelos entrenados con BVD superan a InternVid por hasta 2,1 puntos porcentuales.

LAION acaba de liberar el Big Video Dataset (BVD), uno de los conjuntos de datos de video más grandes disponibles para investigación en inteligencia artificial. La organización descargó 80 millones de videos (10 millones de horas totales) a partir de 1.300 millones de URLs de video encontradas en CommonCrawl, y extrajo 55 millones de clips con descripciones automáticas de video y audio, además de 300 millones de imágenes fijas.
La mayoría de los videos provienen de YouTube y están en inglés, según informó The Decoder.
Rendimiento superior en benchmarks
Según el paper que acompaña el lanzamiento, los modelos entrenados con BVD superan a modelos comparables entrenados con InternVid por hasta 2,1 puntos porcentuales en benchmarks estándar de video-a-texto. El entrenamiento vincula video, audio y texto, enseñando al modelo qué contenido visual corresponde con qué descripciones o sonidos.
Esta integración multimodal permite que los sistemas aprendan relaciones más complejas entre lo que se ve, lo que se escucha y cómo se describe.
Solo para uso no comercial
LAION libera el dataset exclusivamente para investigación. La organización se apoya en un fallo del Tribunal Regional de Hamburgo de 2024 que le permitió recolectar contenido con derechos de autor para investigación no comercial. LAION pide explícitamente a los usuarios que respeten los derechos de los creadores originales de contenido.
El dataset y el código están disponibles gratuitamente.
Por qué importa
Este lanzamiento democratiza el acceso a datos de entrenamiento de video a una escala que antes solo estaba disponible para laboratorios con presupuestos multimillonarios. Para equipos de investigación y empresas que desarrollan modelos de IA generativa de video, tener 10 millones de horas etiquetadas reduce drásticamente la barrera de entrada.
Para organizaciones que construyen aplicaciones de IA sobre video — análisis de contenido, moderación, búsqueda semántica, generación — este tipo de recurso abierto acelera la experimentación sin depender de datasets propietarios. La ventaja de 2,1 puntos sobre InternVid puede parecer marginal, pero en benchmarks competitivos esa diferencia separa un modelo útil de uno comercializable.
La restricción a uso no comercial limita aplicaciones directas en producto, pero no impide que las empresas entrenen prototipos, validen hipótesis o comparen arquitecturas antes de invertir en datos propios.
SEGUIR LA SEÑAL
VER TODO →Cómo se construye un modelo de lenguaje por difusión: la alternativa a GPT
Un paper del Kuleshov Group describe paso a paso cómo funcionan los LLMs por difusión, la arquitectura que compite con los modelos autoregresivos y que ya usan Google, NVIDIA e Inception Labs en producción.
Google DeepMind presenta un co-científico de IA que diseña experimentos y opera equipos de laboratorio
El sistema Co-Scientist de Google DeepMind ya no solo genera hipótesis: ahora planifica experimentos, escribe código, controla equipamiento y redacta papers científicos. En pruebas de tres disciplinas logró 4% de alucinaciones, contra 90% de sistemas anteriores.
Anthropic lanza un estándar para que agentes de IA operen equipamiento físico
El Model Hardware Standard (MHS) permite que agentes como Claude controlen microscopios, brazos robóticos y otros dispositivos de laboratorio sin integraciones custom. Lo que antes tomaba semanas ahora lleva minutos.