Saltar al contenido
NoCodaNOCODA.TVHABLEMOS →
FUNDINGAccel en conversaciones para invertir $1B en Thinking MachinesDATOSam Altman advierte sobre exceso "insostenible" en cómputo de IAMODELOK2 Horizon lanza seis nuevos modelos de IA de código abiertoMODELONuevo modelo de Google mejora drásticamente pronóstico del tiempoPRODUCTOOllie apuesta a la privacidad para ganar carrera de asistentes de IADATOMeta paga a usuarios para monitorear uso de su modelo de IAPRODUCTOAbliteration.ai: negocio de eliminar salvaguardas de IABREAKINGCrusoe levanta USD 3.000 M y triplica valuación en 10 meses con infraestructura de IA alimentada por energía varadaBREAKINGOpenAI destina US$1.000 millones para que defensores cibernéticos protejan infraestructura crítica con IABREAKINGNvidia lanza PAIR: software gratuito que conecta tus PCs para crear un centro de IA localDATONueva York restringe uso de IA en escuelas hasta nivel secundariaMODELOQuasar 438B: Europa presenta su nuevo modelo de IA líderFUNDINGPalo Alto Networks adquiere la startup Console por $500 millonesMODELOOpenAI califica a Astra como su modelo más 'peligroso' y difícil de monitorearDATOMilitares de EE.UU. añaden ChatGPT y Grok a su plataforma GenAI.milPRODUCTOChatGPT: 3 días de trabajo en 3 horas para ATV Big Air TourFUNDINGHiddenLayer obtiene $100M para proteger despliegues de IA empresarialMODELOMeta anuncia Muse Spark 1.3, su nuevo modelo de IA generativaBREAKINGAnthropic invierte USD 35.000 millones con Lambda para expandir infraestructura de Claude en TexasBREAKINGEl DOJ de EE.UU. respalda el uso justo para entrenar IA en el caso del New York Times vs OpenAIBREAKINGGoogle lanza Gemini 3.8 Flash con variante especializada en ciberseguridad al mismo precio que 3.7DATOBenchMIRT: ¿Qué miden realmente los benchmarks de LLM?PRODUCTOHugging Face lanza 200+ WebGPU Kernels para IA localPRODUCTOChatGPT se integra con historiales de salud para organizaciones médicas

ARQUITECTURAS DE IA

Cómo se construye un modelo de lenguaje por difusión: la alternativa a GPT

Un paper del Kuleshov Group describe paso a paso cómo funcionan los LLMs por difusión, la arquitectura que compite con los modelos autoregresivos y que ya usan Google, NVIDIA e Inception Labs en producción.

31 DE AGOSTO DE 202631 AGOLECTURA 3 MINREDACTADO POR IA
Cómo se construye un modelo de lenguaje por difusión: la alternativa a GPT
ILUSTRACIÓN GENERADA POR IA — IDENTIDAD VISUAL NOCODA.TV

Los modelos de lenguaje dominantes —GPT, Claude, Llama— generan texto de izquierda a derecha, un token por vez. Pero hay otra forma de hacerlo: difusión. En lugar de escribir palabra por palabra, estos modelos generan el texto completo de una vez y lo refinan en rondas sucesivas. El Kuleshov Group publicó una guía técnica que explica cómo se construyen, justo cuando Google, NVIDIA e Inception Labs ya tienen modelos de difusión en producción.

Por qué difusión, no autoregresión

Los modelos autoregresivos tienen tres limitaciones estructurales. Primero, no pueden corregir errores: una vez emitido un token, queda fijo. Segundo, son lentos: generan tantos pasos como tokens tiene la salida. Tercero, solo miran hacia atrás: la atención es causal, nunca bidireccional.

Los modelos por difusión arrancan con un borrador completo —texto ruidoso o aleatorio— y lo reescriben varias veces en paralelo. Esto permite corregir errores en cada ronda, ajustar velocidad contra calidad (menos pasos = más rápido, más pasos = mejor resultado) y atender contexto bidireccional en cada iteración.

Para 2026, Mercury 2 (Inception Labs), Gemma Diffusion (Google) y Nemotron Diffusion (NVIDIA) ya son realidad.

Cómo funciona la difusión en texto

La difusión en imágenes es conocida: empezás con ruido gaussiano puro y lo transformás gradualmente en una foto coherente. En texto discreto, la lógica es análoga pero requiere adaptaciones.

El proceso forward toma texto limpio y lo corrompe paso a paso —reemplazando tokens por máscaras o ruido— hasta obtener basura completa. Esto genera ejemplos de entrenamiento gratis: trayectorias que van de texto a ruido.

El proceso reverse entrena un modelo para invertir esa trayectoria: partir del ruido y recuperar el texto original, iteración por iteración. En cada paso, el modelo predice qué tokens limpios corresponden a las posiciones ruidosas y reescribe la secuencia completa. Repetís esto varias veces y el texto emerge.

Decisiones de arquitectura

El paper del Kuleshov Group cubre las decisiones técnicas clave:

  • Masking diffusion como punto de partida: en lugar de ruido gaussiano, enmascará tokens progresivamente.
  • Refinamiento iterativo: el modelo reescribe toda la secuencia en cada paso, no solo las posiciones con mayor incertidumbre.
  • Post-training: técnicas de alineación y ajuste fino que adaptan modelos preentrenados por difusión a tareas específicas.
  • Generación de longitud variable: cómo manejar secuencias de distinto largo sin comprometer la calidad del muestreo.

El material está basado en charlas en ICLR 2026 y MLSS 2026, y apunta a investigadores que quieren implementar estos modelos desde cero o modificar arquitecturas existentes.

Por qué importa

La difusión en lenguaje era un problema abierto hasta 2024. Hoy es una opción viable en producción, con ventajas concretas: mejor para tareas que requieren edición iterativa, generación controlada o trade-offs dinámicos entre latencia y calidad.

Para equipos que construyen productos con LLMs, entender esta arquitectura abre nuevas posibilidades de diseño: sistemas que refinan borradores en lugar de generar de cero, pipelines que ajustan velocidad según el contexto, o herramientas que explotan atención bidireccional para tareas de edición.

No reemplaza a los modelos autoregresivos en todos los casos, pero tampoco es una curiosidad académica. Es una segunda familia de arquitecturas viable, con compromisos distintos y casos de uso propios.

#difusión#llm#investigación#arquitectura#transformers

SEGUIR LA SEÑAL

VER TODO →