INGENIERÍA DE VOZ
OpenAI revela cómo construyó GPT-Live, su sistema de voz full-duplex
El equipo de OpenAI publicó los detalles técnicos de GPT-Live, su sistema de tercera generación que elimina los detectores de turno y permite conversaciones bidireccionales en tiempo real con latencias inferiores al segundo.

OpenAI acaba de levantar el capó de GPT-Live, su sistema de voz de tercera generación que permite conversaciones bidireccionales en tiempo real. En un artículo técnico publicado por Justin Uberti y Zahan Malkani, la compañía detalla cómo eliminó el cuello de botella tradicional de los sistemas de voz basados en IA: el detector de turnos.
Según explican en OpenAI, los sistemas anteriores dependían de modelos pequeños que debían adivinar cuándo terminaba de hablar el usuario. Si el detector se apuraba, cortaba al usuario; si esperaba demasiado, la respuesta se sentía lenta. Solo después de esa decisión el LLM grande podía empezar a trabajar.
Full-duplex: hablar y escuchar al mismo tiempo
GPT-Live elimina ese intermediario. Su modelo de voz es full-duplex, capaz de escuchar y hablar simultáneamente. El audio fluye hacia dentro y hacia fuera del modelo sin interrupciones, mientras que tareas más pesadas como razonamiento profundo o uso de herramientas se delegan de forma asíncrona a modelos como GPT-5.5.
Esta arquitectura separa el camino crítico del audio de la lógica de aplicación. Las herramientas, políticas y servicios backend pueden cambiar sin afectar el flujo de medios. Un tool call lento puede retrasar su propio resultado, pero no puede frenar la conversación.
Seis meses de rediseño de stack completo
La transición de sistemas basados en turnos a streaming continuo obligó al equipo a repensar inferencia, gestión de contexto y transporte de medios. Reescribieron el frontend de medios y la lógica de inferencia en Go, reemplazando una implementación previa en Python asyncio. El resultado: el p95 del nuevo sistema iguala el p50 del anterior en suavidad de entrega de frames.
WebRTC provee la base de transporte. Está diseñado para medios de baja latencia y puede seguir operando a través de pérdida de paquetes, desfase de reloj y cambios de conexión del cliente. Si los paquetes llegan tarde, WebRTC puede estirar sutilmente el audio para prevenir huecos y luego acelerar brevemente la reproducción para volver al tiempo real.
Por qué importa
Esta arquitectura marca un cambio de paradigma en cómo se construyen sistemas de voz con IA. La mayoría de las implementaciones actuales heredan el diseño turn-based de los LLMs de texto, donde cada turno es un blob discreto de audio. GPT-Live demuestra que es posible mantener un loop de medios ininterrumpido con latencias de conversación humana.
Para equipos de producto considerando capacidades de voz avanzadas, el artículo ofrece un blueprint técnico concreto: separar el camino crítico del audio de la lógica de negocio, usar transporte optimizado para tiempo real, y diseñar para inferencia stateful continua en lugar de request-response.
La arquitectura también habilita nuevas capacidades en ChatGPT Voice, incluyendo control de computadora y coordinación de agentes en la app de escritorio. Al mantener el live path pequeño, predecible y enfocado en trabajo que debe ocurrir en tiempo real, OpenAI construyó una base escalable para conversaciones de IA que se sienten verdaderamente naturales.
SEGUIR LA SEÑAL
VER TODO →Google Gemini Omni 1.1 Flash baja 60% el costo de generar video con IA
La nueva versión del modelo de Google introduce un modo borrador a 360p que cuesta un tercio que la resolución estándar y procesa hasta 60% más rápido. Permite extender escenas hasta 40 segundos y usar footage externo como referencia de estilo.
GLM-5.3-Flash: el modelo chino que promete redefinir eficiencia en LLMs
Z.ai lanzó GLM-5.3-Flash, un modelo de lenguaje open source que busca competir en rendimiento con los gigantes del sector mientras reduce drásticamente los costos de inferencia. La propuesta china apunta directo al dolor de las empresas.
Los agentes de IA ya consumen 14 veces más tokens que los humanos en OpenRouter
Febrero de 2026 fue probablemente el último mes en que humanos consumieron más tokens que agentes autónomos. Desde entonces, el uso agéntico creció 14x mientras el humano apenas 2,8x, según datos de OpenRouter.