STREAMING Y MACHINE LEARNING
Netflix prueba un modelo de lenguaje para reemplazar su sistema de recomendación
La plataforma desarrolló GenRec, un sistema basado en IA generativa que superó su motor de recomendación tradicional usando 40 veces menos datos de entrenamiento. El experimento con usuarios reales mostró mejoras medibles.

Netflix construyó un sistema de recomendación basado en modelos de lenguaje que superó a su infraestructura actual, desarrollada durante años. El proyecto, llamado GenRec, necesitó una fracción de los datos de entrenamiento que requiere el sistema en producción y mostró mejoras estadísticamente significativas en pruebas con usuarios reales, según publicó el equipo técnico de Netflix esta semana.
El sistema actual de la plataforma depende de miles de características diseñadas manualmente sobre usuarios, títulos e interacciones. Esa complejidad encarece la incorporación de nuevos formatos como videojuegos, transmisiones en vivo o podcasts, y dificulta expandir recomendaciones a otras áreas de la interfaz.
Cómo funciona GenRec
Netflix entrena un modelo propietario en dos etapas. Primero ajusta un modelo de lenguaje de pesos abiertos (no especifica cuál) con datos internos para que comprenda el catálogo y el comportamiento de usuarios. Luego, una segunda ronda de entrenamiento especializado convierte ese modelo base en un rankeador de recomendaciones que se actualiza con mayor frecuencia para incorporar títulos nuevos y cambios en las preferencias.
La diferencia clave: GenRec convierte el historial de visualización en texto plano en lugar de codificarlo como vectores numéricos densos. Reproducciones, duraciones, reacciones con pulgar arriba o abajo, agregados a listas y abandonos se transforman en una especie de diálogo entre el usuario y el sistema. El modelo identifica patrones como preferencias de género o cambios de interés por sí mismo, sin necesidad de características diseñadas manualmente.
Para evitar que el modelo sugiera títulos inexistentes en el catálogo, Netflix agregó un componente separado que solo califica entradas reales. El sistema corre sobre vLLM en un modo donde lee la entrada una vez y califica todos los candidatos en una sola pasada, sin generar texto, lo que mantiene los costos manejables.
Resultados de las pruebas
En evaluaciones offline, GenRec entregó 1,6% mejor calidad de ranking comparado con el sistema en producción. Necesitó aproximadamente 40 veces menos ejemplos etiquetados en la segunda etapa de entrenamiento para alcanzar ese resultado. Esa comparación aplica específicamente a la Fase 2, no a todos los datos de entrenamiento.
Netflix ejecutó un experimento A/B de cuatro semanas sobre aproximadamente el 10% de su tráfico, limitado a superficies de recomendación pre-computadas. Una métrica de corto plazo que rastrea comportamiento en la pantalla principal subió 0,115%, y una métrica central de largo plazo mejoró 0,006%. Ambas ganancias son demasiado grandes para explicarse por azar, según la compañía.
El ajuste fino específico para recomendaciones en la Fase 2 agrega entre 35% y 50% adicional sobre el rendimiento del modelo base. Cuando el modelo base tiene dos semanas de antigüedad, esa brecha se amplía a cerca del 80%, porque ya no refleja títulos nuevos ni preferencias modificadas. Los modelos de recomendación pierden vigencia rápido.
Por qué importa
Netflix ve a GenRec como parte de un cambio más amplio en la industria: pasar de arquitecturas personalizadas a modelos de lenguaje de propósito general que manejan múltiples casos de uso. El trabajo se desplaza de construir cada vez más características a decidir qué señales incluir en la entrada del modelo y en qué proporción. La infraestructura también migra hacia servidores GPU y herramientas para LLMs.
Este enfoque reduce drásticamente el esfuerzo de ingeniería para expandir recomendaciones a nuevos formatos de contenido. Lo que antes requería meses de desarrollo de características ahora puede resolverse ajustando el contexto textual que recibe el modelo. Para plataformas de comercio electrónico o productos digitales con catálogos dinámicos, el precedente es directo: sistemas de recomendación más flexibles que se adaptan más rápido y con menos datos.
El equipo de Netflix describe a GenRec como "un paso temprano pero prometedor" y aclara que no hay planes inmediatos para reemplazar completamente el sistema existente. La compañía lleva años usando machine learning más allá de las listas de recomendación: desde 2020 emplea grafos de conocimiento y modelos de similitud para predecir categorías de contenido y audiencias potenciales por país.
// FUENTES
SEGUIR LA SEÑAL
VER TODO →Anthropic cierra contrato de US$45.000 millones con Nscale antes de su IPO
La creadora de Claude firmó un acuerdo por seis años para arrendar capacidad de cómputo en un datacenter de Virginia Occidental. El contrato forma parte de una estrategia agresiva para asegurar chips antes de salir a bolsa este otoño.
Meta canceló plan para reemplazar 60% de empleados con agentes de IA
Mark Zuckerberg frenó Project OT, la iniciativa para volver a Meta
Nvidia compra Hugging Face por USD 12.900 millones mientras los labs cerrados se alejan de sus chips
Nvidia adquiere la plataforma open-source Hugging Face por 12.900 millones de dólares, pagando 80 veces su facturación anual. El movimiento responde a que OpenAI, Anthropic y Google desarrollan chips propios para reducir dependencia del gigante del hardware.