MÉTRICAS DE PRODUCTIVIDAD
OpenAI lanza un 'scorecard' para medir el ROI real de la IA en empresas
La compañía propone abandonar métricas tradicionales como cantidad de usuarios activos y medir en cambio 'inteligencia útil por dólar': cuánto trabajo concreto completa la IA, a qué costo, y con qué confiabilidad.

Los CFOs de todo el mundo le hacen la misma pregunta a OpenAI: ¿cómo sacamos más valor de lo que gastamos en IA? La respuesta que propone la compañía implica cambiar radicalmente cómo se mide el éxito de estos sistemas.
En un documento publicado esta semana, OpenAI plantea que las métricas tradicionales del software —licencias vendidas, usuarios activos— no sirven para evaluar IA. Lo que importa, dice, es cuánto trabajo útil se completa y a qué costo total.
El scorecard: cuatro preguntas clave
La propuesta se resume en lo que OpenAI llama "Useful Intelligence per Dollar" (inteligencia útil por dólar), un marco que responde cuatro preguntas:
1. ¿Cuánto trabajo útil se hace? No tokens generados, sino tareas terminadas: issues de soporte resueltos, cambios de código enviados a producción, contratos revisados. OpenAI pone el ejemplo de un equipo de finanzas preparando un forecast: antes de decidir nada, hay que buscar el último archivo, mover datos a Excel, reconciliar pestañas, actualizar slides. ChatGPT Work puede encargarse de eso, liberando tiempo para análisis.
2. ¿Cuánto cuesta realmente cada tarea exitosa? Acá es donde el costo por token se vuelve insuficiente. Un modelo barato puede requerir varios intentos, revisión humana, retrabajos. Uno más caro puede resolver en una pasada. La métrica correcta es costo total dividido tareas completadas con éxito. OpenAI argumenta que su GPT-5.6 Sol, con max reasoning, alcanzó 72,7% en el Artificial Analysis Coding Agent Index usando 54% menos tokens de salida que otros modelos líderes, y 36,2% menor costo estimado de API que Claude Fable 5 (69,9%).
3. ¿Qué tan seguido la IA acierta? La confiabilidad tiene valor económico directo: resultados precisos, bien citados y consistentes reducen tiempo de revisión. OpenAI sugiere trackear tres outcomes: listo para usar, requiere edición menor, necesita rehacerse.
4. ¿El valor crece más rápido que el costo? La pregunta económica fundamental para cualquier CFO.
Tres tiers, un objetivo
Para optimizar esa ecuación, OpenAI lanzó GPT-5.6 en tres niveles: Sol (flagship), Terra (balance), Luna (rápido y económico). La idea es que cada empresa elija según el tipo de tarea: Luna para volumen alto y rapidez, Terra para profundidad, Sol cuando el razonamiento fuerte reduce intentos.
La compañía entrenó GPT-5.6 para "sacar más trabajo útil de cada token", con el objetivo de que cada generación mejore ambos lados: más trabajo valioso y menor costo por tarea.
Por qué importa
Este scorecard es un intento de llevar la conversación sobre IA del hype a la planilla de Excel del CFO. Para equipos que ya implementaron IA, el framework ofrece un lenguaje común: dejar de contar "consultas a la API" y empezar a medir cuántos contratos se revisaron bien, cuántos bugs se resolvieron sin intervención humana, cuántas horas se devolvieron al equipo.
Para empresas evaluando proveedores, la propuesta es clara: el modelo más barato por token no siempre es el más barato por resultado. Lo que cuenta es el costo total de obtener un outcome exitoso, incluyendo reintentos, latencia y revisión.
OpenAI no inventó el concepto de medir ROI, pero sí está formalizando un marco en un momento en que muchas organizaciones gastan sin saber qué obtienen a cambio. Si la industria adopta este tipo de métricas, las conversaciones sobre IA en los boards van a sonar muy distintas: menos "transformación", más "cuánto nos cuesta resolver un ticket de soporte".
// FUENTES
SEGUIR LA SEÑAL
VER TODO →Anthropic lanza un estándar para que agentes de IA operen equipamiento físico
El Model Hardware Standard (MHS) permite que agentes como Claude controlen microscopios, brazos robóticos y otros dispositivos de laboratorio sin integraciones custom. Lo que antes tomaba semanas ahora lleva minutos.
OpenAI presenta Jalapeño: su chip de inferencia propio supera 3× en latencia
El primer chip personalizado de OpenAI para inferencia muestra hasta 3.6× menos latencia y casi el doble de eficiencia energética que sistemas comerciales. Funciona con modelos propios y de terceros, incluyendo DeepSeek R1.
LLMs podrían explotar sus propios motores de inferencia para tomar control
Una investigación revela cómo modelos de lenguaje maliciosos podrían ejecutar código arbitrario en las máquinas GPU que los alojan, explotando bugs en vLLM y otros motores de inferencia. El ataque no requiere acceso externo.