Saltar al contenido
NoCodaNOCODA.TVHABLEMOS →
PRODUCTOPlaud lanza auriculares con eSIM para agentes de IADATOBarret Zoph, ex-OpenAI, se une a GoogleFUNDINGOpenAI expande su presencia a BrasilDATOAustralia prohíbe IA generativa en listas musicalesMODELOReportan el ascenso de los modelos de IA pequeñosDATOIndustria IA critica plan de Trump de gravar chipsPRODUCTOGoogle Search integra IA para planificar y reservar viajesDATOJensen Huang (Nvidia) afirma haber logrado AGI 'sin sentido'BREAKINGOpenAI lanza publicidad en ChatGPT gratuito y Go en India con 50 marcas y ad manager desde septiembreBREAKINGGoogle Gemini Omni 1.1 Flash baja 60% el costo de generar video con IA y procesa más rápidoBREAKINGAnthropic lanza estándar para que agentes de IA controlen equipamiento físico de laboratorio y fábricaBREAKINGAnthropic firma contrato de US$45 mil millones con Nscale para capacidad de cómputo previo a su IPODATOAmazon triplica pedidos de chips Nvidia por demanda crecienteDATONvidia camino a ser empresa de $100 mil millones por trimestreBREAKINGSam Altman: AGI de OpenAI para fines de 2026 (según su definición)FUNDINGStartup viral Instinct levanta $350M con valuación de $2.5BFUNDINGAnthropic cierra acuerdo de $45B con Nscale por cómputo de IAPRODUCTOGoogle lanza Gemini 3.5 Transcribe, edita 'ums' y 'ahs'MODELOIBM libera Granite 4.2: modelos open-weight con agentesMODELOAlibaba lanza Qwen3.8-Flash-Next: eficiencia de costo extremaBREAKINGIsrael montó un think tank falso para manipular chatbots con propaganda disfrazada de investigación académicaBREAKINGMeta canceló plan para reemplazar 60% de empleados con IA tras aumento del 40% en incidentes técnicosBREAKINGNvidia compra Hugging Face por USD 12.900 millones mientras OpenAI y Anthropic desarrollan chips propiosBREAKINGZ.ai lanza GLM-5.3-Flash, modelo open source chino que promete alto rendimiento y costos reducidos

MÉTRICAS DE PRODUCTIVIDAD

OpenAI lanza un 'scorecard' para medir el ROI real de la IA en empresas

La compañía propone abandonar métricas tradicionales como cantidad de usuarios activos y medir en cambio 'inteligencia útil por dólar': cuánto trabajo concreto completa la IA, a qué costo, y con qué confiabilidad.

18 DE JULIO DE 202618 JULLECTURA 3 MINREDACTADO POR IA
OpenAI lanza un 'scorecard' para medir el ROI real de la IA en empresas
ILUSTRACIÓN GENERADA POR IA — IDENTIDAD VISUAL NOCODA.TV

Los CFOs de todo el mundo le hacen la misma pregunta a OpenAI: ¿cómo sacamos más valor de lo que gastamos en IA? La respuesta que propone la compañía implica cambiar radicalmente cómo se mide el éxito de estos sistemas.

En un documento publicado esta semana, OpenAI plantea que las métricas tradicionales del software —licencias vendidas, usuarios activos— no sirven para evaluar IA. Lo que importa, dice, es cuánto trabajo útil se completa y a qué costo total.

El scorecard: cuatro preguntas clave

La propuesta se resume en lo que OpenAI llama "Useful Intelligence per Dollar" (inteligencia útil por dólar), un marco que responde cuatro preguntas:

1. ¿Cuánto trabajo útil se hace? No tokens generados, sino tareas terminadas: issues de soporte resueltos, cambios de código enviados a producción, contratos revisados. OpenAI pone el ejemplo de un equipo de finanzas preparando un forecast: antes de decidir nada, hay que buscar el último archivo, mover datos a Excel, reconciliar pestañas, actualizar slides. ChatGPT Work puede encargarse de eso, liberando tiempo para análisis.

2. ¿Cuánto cuesta realmente cada tarea exitosa? Acá es donde el costo por token se vuelve insuficiente. Un modelo barato puede requerir varios intentos, revisión humana, retrabajos. Uno más caro puede resolver en una pasada. La métrica correcta es costo total dividido tareas completadas con éxito. OpenAI argumenta que su GPT-5.6 Sol, con max reasoning, alcanzó 72,7% en el Artificial Analysis Coding Agent Index usando 54% menos tokens de salida que otros modelos líderes, y 36,2% menor costo estimado de API que Claude Fable 5 (69,9%).

3. ¿Qué tan seguido la IA acierta? La confiabilidad tiene valor económico directo: resultados precisos, bien citados y consistentes reducen tiempo de revisión. OpenAI sugiere trackear tres outcomes: listo para usar, requiere edición menor, necesita rehacerse.

4. ¿El valor crece más rápido que el costo? La pregunta económica fundamental para cualquier CFO.

Tres tiers, un objetivo

Para optimizar esa ecuación, OpenAI lanzó GPT-5.6 en tres niveles: Sol (flagship), Terra (balance), Luna (rápido y económico). La idea es que cada empresa elija según el tipo de tarea: Luna para volumen alto y rapidez, Terra para profundidad, Sol cuando el razonamiento fuerte reduce intentos.

La compañía entrenó GPT-5.6 para "sacar más trabajo útil de cada token", con el objetivo de que cada generación mejore ambos lados: más trabajo valioso y menor costo por tarea.

Por qué importa

Este scorecard es un intento de llevar la conversación sobre IA del hype a la planilla de Excel del CFO. Para equipos que ya implementaron IA, el framework ofrece un lenguaje común: dejar de contar "consultas a la API" y empezar a medir cuántos contratos se revisaron bien, cuántos bugs se resolvieron sin intervención humana, cuántas horas se devolvieron al equipo.

Para empresas evaluando proveedores, la propuesta es clara: el modelo más barato por token no siempre es el más barato por resultado. Lo que cuenta es el costo total de obtener un outcome exitoso, incluyendo reintentos, latencia y revisión.

OpenAI no inventó el concepto de medir ROI, pero sí está formalizando un marco en un momento en que muchas organizaciones gastan sin saber qué obtienen a cambio. Si la industria adopta este tipo de métricas, las conversaciones sobre IA en los boards van a sonar muy distintas: menos "transformación", más "cuánto nos cuesta resolver un ticket de soporte".

#openai#gpt-5#métricas#roi#enterprise

SEGUIR LA SEÑAL

VER TODO →