ARQUITECTURAS DE IA
Cómo se construye un modelo de lenguaje por difusión: la alternativa a GPT
Un paper del Kuleshov Group describe paso a paso cómo funcionan los LLMs por difusión, la arquitectura que compite con los modelos autoregresivos y que ya usan Google, NVIDIA e Inception Labs en producción.

Los modelos de lenguaje dominantes —GPT, Claude, Llama— generan texto de izquierda a derecha, un token por vez. Pero hay otra forma de hacerlo: difusión. En lugar de escribir palabra por palabra, estos modelos generan el texto completo de una vez y lo refinan en rondas sucesivas. El Kuleshov Group publicó una guía técnica que explica cómo se construyen, justo cuando Google, NVIDIA e Inception Labs ya tienen modelos de difusión en producción.
Por qué difusión, no autoregresión
Los modelos autoregresivos tienen tres limitaciones estructurales. Primero, no pueden corregir errores: una vez emitido un token, queda fijo. Segundo, son lentos: generan tantos pasos como tokens tiene la salida. Tercero, solo miran hacia atrás: la atención es causal, nunca bidireccional.
Los modelos por difusión arrancan con un borrador completo —texto ruidoso o aleatorio— y lo reescriben varias veces en paralelo. Esto permite corregir errores en cada ronda, ajustar velocidad contra calidad (menos pasos = más rápido, más pasos = mejor resultado) y atender contexto bidireccional en cada iteración.
Para 2026, Mercury 2 (Inception Labs), Gemma Diffusion (Google) y Nemotron Diffusion (NVIDIA) ya son realidad.
Cómo funciona la difusión en texto
La difusión en imágenes es conocida: empezás con ruido gaussiano puro y lo transformás gradualmente en una foto coherente. En texto discreto, la lógica es análoga pero requiere adaptaciones.
El proceso forward toma texto limpio y lo corrompe paso a paso —reemplazando tokens por máscaras o ruido— hasta obtener basura completa. Esto genera ejemplos de entrenamiento gratis: trayectorias que van de texto a ruido.
El proceso reverse entrena un modelo para invertir esa trayectoria: partir del ruido y recuperar el texto original, iteración por iteración. En cada paso, el modelo predice qué tokens limpios corresponden a las posiciones ruidosas y reescribe la secuencia completa. Repetís esto varias veces y el texto emerge.
Decisiones de arquitectura
El paper del Kuleshov Group cubre las decisiones técnicas clave:
- Masking diffusion como punto de partida: en lugar de ruido gaussiano, enmascará tokens progresivamente.
- Refinamiento iterativo: el modelo reescribe toda la secuencia en cada paso, no solo las posiciones con mayor incertidumbre.
- Post-training: técnicas de alineación y ajuste fino que adaptan modelos preentrenados por difusión a tareas específicas.
- Generación de longitud variable: cómo manejar secuencias de distinto largo sin comprometer la calidad del muestreo.
El material está basado en charlas en ICLR 2026 y MLSS 2026, y apunta a investigadores que quieren implementar estos modelos desde cero o modificar arquitecturas existentes.
Por qué importa
La difusión en lenguaje era un problema abierto hasta 2024. Hoy es una opción viable en producción, con ventajas concretas: mejor para tareas que requieren edición iterativa, generación controlada o trade-offs dinámicos entre latencia y calidad.
Para equipos que construyen productos con LLMs, entender esta arquitectura abre nuevas posibilidades de diseño: sistemas que refinan borradores en lugar de generar de cero, pipelines que ajustan velocidad según el contexto, o herramientas que explotan atención bidireccional para tareas de edición.
No reemplaza a los modelos autoregresivos en todos los casos, pero tampoco es una curiosidad académica. Es una segunda familia de arquitecturas viable, con compromisos distintos y casos de uso propios.
SEGUIR LA SEÑAL
VER TODO →Google DeepMind presenta un co-científico de IA que diseña experimentos y opera equipos de laboratorio
El sistema Co-Scientist de Google DeepMind ya no solo genera hipótesis: ahora planifica experimentos, escribe código, controla equipamiento y redacta papers científicos. En pruebas de tres disciplinas logró 4% de alucinaciones, contra 90% de sistemas anteriores.
LAION lanza dataset de 10 millones de horas de video para entrenar modelos de IA
El dataset Big Video Dataset (BVD) contiene 55 millones de clips con descripciones de audio y video generadas automáticamente, más 300 millones de imágenes. Modelos entrenados con BVD superan a InternVid por hasta 2,1 puntos porcentuales.
Anthropic lanza un estándar para que agentes de IA operen equipamiento físico
El Model Hardware Standard (MHS) permite que agentes como Claude controlen microscopios, brazos robóticos y otros dispositivos de laboratorio sin integraciones custom. Lo que antes tomaba semanas ahora lleva minutos.