Saltar al contenido
NoCodaNOCODA.TVHABLEMOS →
PRODUCTOPlaud lanza auriculares con eSIM para agentes de IADATOBarret Zoph, ex-OpenAI, se une a GoogleFUNDINGOpenAI expande su presencia a BrasilDATOAustralia prohíbe IA generativa en listas musicalesMODELOReportan el ascenso de los modelos de IA pequeñosDATOIndustria IA critica plan de Trump de gravar chipsPRODUCTOGoogle Search integra IA para planificar y reservar viajesDATOJensen Huang (Nvidia) afirma haber logrado AGI 'sin sentido'BREAKINGOpenAI lanza publicidad en ChatGPT gratuito y Go en India con 50 marcas y ad manager desde septiembreBREAKINGGoogle Gemini Omni 1.1 Flash baja 60% el costo de generar video con IA y procesa más rápidoBREAKINGAnthropic lanza estándar para que agentes de IA controlen equipamiento físico de laboratorio y fábricaBREAKINGAnthropic firma contrato de US$45 mil millones con Nscale para capacidad de cómputo previo a su IPODATOAmazon triplica pedidos de chips Nvidia por demanda crecienteDATONvidia camino a ser empresa de $100 mil millones por trimestreBREAKINGSam Altman: AGI de OpenAI para fines de 2026 (según su definición)FUNDINGStartup viral Instinct levanta $350M con valuación de $2.5BFUNDINGAnthropic cierra acuerdo de $45B con Nscale por cómputo de IAPRODUCTOGoogle lanza Gemini 3.5 Transcribe, edita 'ums' y 'ahs'MODELOIBM libera Granite 4.2: modelos open-weight con agentesMODELOAlibaba lanza Qwen3.8-Flash-Next: eficiencia de costo extremaBREAKINGIsrael montó un think tank falso para manipular chatbots con propaganda disfrazada de investigación académicaBREAKINGMeta canceló plan para reemplazar 60% de empleados con IA tras aumento del 40% en incidentes técnicosBREAKINGNvidia compra Hugging Face por USD 12.900 millones mientras OpenAI y Anthropic desarrollan chips propiosBREAKINGZ.ai lanza GLM-5.3-Flash, modelo open source chino que promete alto rendimiento y costos reducidos

INGENIERÍA DE VOZ

OpenAI revela cómo construyó GPT-Live, su sistema de voz full-duplex

El equipo de OpenAI publicó los detalles técnicos de GPT-Live, su sistema de tercera generación que elimina los detectores de turno y permite conversaciones bidireccionales en tiempo real con latencias inferiores al segundo.

4 DE AGOSTO DE 20264 AGOLECTURA 3 MINREDACTADO POR IA
OpenAI revela cómo construyó GPT-Live, su sistema de voz full-duplex
ILUSTRACIÓN GENERADA POR IA — IDENTIDAD VISUAL NOCODA.TV

OpenAI acaba de levantar el capó de GPT-Live, su sistema de voz de tercera generación que permite conversaciones bidireccionales en tiempo real. En un artículo técnico publicado por Justin Uberti y Zahan Malkani, la compañía detalla cómo eliminó el cuello de botella tradicional de los sistemas de voz basados en IA: el detector de turnos.

Según explican en OpenAI, los sistemas anteriores dependían de modelos pequeños que debían adivinar cuándo terminaba de hablar el usuario. Si el detector se apuraba, cortaba al usuario; si esperaba demasiado, la respuesta se sentía lenta. Solo después de esa decisión el LLM grande podía empezar a trabajar.

Full-duplex: hablar y escuchar al mismo tiempo

GPT-Live elimina ese intermediario. Su modelo de voz es full-duplex, capaz de escuchar y hablar simultáneamente. El audio fluye hacia dentro y hacia fuera del modelo sin interrupciones, mientras que tareas más pesadas como razonamiento profundo o uso de herramientas se delegan de forma asíncrona a modelos como GPT-5.5.

Esta arquitectura separa el camino crítico del audio de la lógica de aplicación. Las herramientas, políticas y servicios backend pueden cambiar sin afectar el flujo de medios. Un tool call lento puede retrasar su propio resultado, pero no puede frenar la conversación.

Seis meses de rediseño de stack completo

La transición de sistemas basados en turnos a streaming continuo obligó al equipo a repensar inferencia, gestión de contexto y transporte de medios. Reescribieron el frontend de medios y la lógica de inferencia en Go, reemplazando una implementación previa en Python asyncio. El resultado: el p95 del nuevo sistema iguala el p50 del anterior en suavidad de entrega de frames.

WebRTC provee la base de transporte. Está diseñado para medios de baja latencia y puede seguir operando a través de pérdida de paquetes, desfase de reloj y cambios de conexión del cliente. Si los paquetes llegan tarde, WebRTC puede estirar sutilmente el audio para prevenir huecos y luego acelerar brevemente la reproducción para volver al tiempo real.

Por qué importa

Esta arquitectura marca un cambio de paradigma en cómo se construyen sistemas de voz con IA. La mayoría de las implementaciones actuales heredan el diseño turn-based de los LLMs de texto, donde cada turno es un blob discreto de audio. GPT-Live demuestra que es posible mantener un loop de medios ininterrumpido con latencias de conversación humana.

Para equipos de producto considerando capacidades de voz avanzadas, el artículo ofrece un blueprint técnico concreto: separar el camino crítico del audio de la lógica de negocio, usar transporte optimizado para tiempo real, y diseñar para inferencia stateful continua en lugar de request-response.

La arquitectura también habilita nuevas capacidades en ChatGPT Voice, incluyendo control de computadora y coordinación de agentes en la app de escritorio. Al mantener el live path pequeño, predecible y enfocado en trabajo que debe ocurrir en tiempo real, OpenAI construyó una base escalable para conversaciones de IA que se sienten verdaderamente naturales.

#gpt-live#voz#openai#inferencia#tiempo-real

SEGUIR LA SEÑAL

VER TODO →