Saltar al contenido
NoCodaNOCODA.TVHABLEMOS →
PRODUCTOPlaud lanza auriculares con eSIM para agentes de IADATOBarret Zoph, ex-OpenAI, se une a GoogleFUNDINGOpenAI expande su presencia a BrasilDATOAustralia prohíbe IA generativa en listas musicalesMODELOReportan el ascenso de los modelos de IA pequeñosDATOIndustria IA critica plan de Trump de gravar chipsPRODUCTOGoogle Search integra IA para planificar y reservar viajesDATOJensen Huang (Nvidia) afirma haber logrado AGI 'sin sentido'BREAKINGOpenAI lanza publicidad en ChatGPT gratuito y Go en India con 50 marcas y ad manager desde septiembreBREAKINGGoogle Gemini Omni 1.1 Flash baja 60% el costo de generar video con IA y procesa más rápidoBREAKINGAnthropic lanza estándar para que agentes de IA controlen equipamiento físico de laboratorio y fábricaBREAKINGAnthropic firma contrato de US$45 mil millones con Nscale para capacidad de cómputo previo a su IPODATOAmazon triplica pedidos de chips Nvidia por demanda crecienteDATONvidia camino a ser empresa de $100 mil millones por trimestreBREAKINGSam Altman: AGI de OpenAI para fines de 2026 (según su definición)FUNDINGStartup viral Instinct levanta $350M con valuación de $2.5BFUNDINGAnthropic cierra acuerdo de $45B con Nscale por cómputo de IAPRODUCTOGoogle lanza Gemini 3.5 Transcribe, edita 'ums' y 'ahs'MODELOIBM libera Granite 4.2: modelos open-weight con agentesMODELOAlibaba lanza Qwen3.8-Flash-Next: eficiencia de costo extremaBREAKINGIsrael montó un think tank falso para manipular chatbots con propaganda disfrazada de investigación académicaBREAKINGMeta canceló plan para reemplazar 60% de empleados con IA tras aumento del 40% en incidentes técnicosBREAKINGNvidia compra Hugging Face por USD 12.900 millones mientras OpenAI y Anthropic desarrollan chips propiosBREAKINGZ.ai lanza GLM-5.3-Flash, modelo open source chino que promete alto rendimiento y costos reducidos

BENCHMARKS REALES

GPT-5.6 duplica la velocidad y reduce 27% el costo de un agente de IA en producción

Ploy migró su agente de creación de sitios web de Claude Opus 4.8 a GPT-5.6 y documentó el resultado: builds 2.2× más rápidos, 27% más baratos y mejor calidad visual. El caso expone las trampas técnicas del cambio de proveedor.

13 DE JULIO DE 202613 JULLECTURA 4 MINREDACTADO POR IA
GPT-5.6 duplica la velocidad y reduce 27% el costo de un agente de IA en producción
ILUSTRACIÓN GENERADA POR IA — IDENTIDAD VISUAL NOCODA.TV

El primer modelo que destronó a Opus

Ploy, una plataforma que usa agentes de IA para construir sitios de marketing en producción, acaba de publicar su migración a GPT-5.6 Sol, el modelo flagship que OpenAI lanzó esta semana. Durante cuatro meses, ningún modelo había logrado superar a Claude Opus en las evaluaciones internas de la compañía. GPT-5.6 lo hizo.

El agente de Ploy planifica páginas, lee código, escribe componentes, genera imágenes, toma capturas de su propio trabajo y decide cuándo terminó. Después de ajustar el harness de evaluación y los schemas de herramientas, los builds completados tomaron menos de la mitad del tiempo (3m 42s vs. 8m 00s), costaron 27% menos ($2.22 vs. $3.06 por build) y obtuvieron mejor puntaje visual (0.970 vs. 0.936).

Las trampas del cambio de proveedor

Ploy usa el AI SDK de Vercel, pero migrar de Claude Opus 4.8 a GPT-5.6 expuso diferencias de comportamiento en tres capas: cómo los modelos llenan argumentos de herramientas, cómo cachean prompts y cómo reiteran razonamiento entre turnos.

El primer problema apareció en las llamadas a herramientas. Claude envía solo los 2 o 3 parámetros que usa de una herramienta con 25 campos opcionales; GPT-5.6 envía los 25, llenando los no usados con valores inventados como offset: 0 o siteId: "00000000-0000-0000-0000-000000000000". La implementación de lectura de archivos no distinguía un valor inventado de uno real: entre 52% y 64% de las lecturas de GPT-5.6 devolvían vacío. El modelo compensaba con más llamadas y peores resultados.

La solución fue reescribir el schema en el boundary del proveedor: para modelos de OpenAI, Ploy convierte cada propiedad opcional en required pero nullable usando anyOf: [T, null], y luego elimina los nulls antes de la validación. El prompting directo (

#gpt-5.6#agentes de ia#benchmarks#claude opus#costos de modelos

SEGUIR LA SEÑAL

VER TODO →