Saltar al contenido
NoCodaNOCODA.TVHABLEMOS →
PRODUCTOPlaud lanza auriculares con eSIM para agentes de IADATOBarret Zoph, ex-OpenAI, se une a GoogleFUNDINGOpenAI expande su presencia a BrasilDATOAustralia prohíbe IA generativa en listas musicalesMODELOReportan el ascenso de los modelos de IA pequeñosDATOIndustria IA critica plan de Trump de gravar chipsPRODUCTOGoogle Search integra IA para planificar y reservar viajesDATOJensen Huang (Nvidia) afirma haber logrado AGI 'sin sentido'BREAKINGOpenAI lanza publicidad en ChatGPT gratuito y Go en India con 50 marcas y ad manager desde septiembreBREAKINGGoogle Gemini Omni 1.1 Flash baja 60% el costo de generar video con IA y procesa más rápidoBREAKINGAnthropic lanza estándar para que agentes de IA controlen equipamiento físico de laboratorio y fábricaBREAKINGAnthropic firma contrato de US$45 mil millones con Nscale para capacidad de cómputo previo a su IPODATOAmazon triplica pedidos de chips Nvidia por demanda crecienteDATONvidia camino a ser empresa de $100 mil millones por trimestreBREAKINGSam Altman: AGI de OpenAI para fines de 2026 (según su definición)FUNDINGStartup viral Instinct levanta $350M con valuación de $2.5BFUNDINGAnthropic cierra acuerdo de $45B con Nscale por cómputo de IAPRODUCTOGoogle lanza Gemini 3.5 Transcribe, edita 'ums' y 'ahs'MODELOIBM libera Granite 4.2: modelos open-weight con agentesMODELOAlibaba lanza Qwen3.8-Flash-Next: eficiencia de costo extremaBREAKINGIsrael montó un think tank falso para manipular chatbots con propaganda disfrazada de investigación académicaBREAKINGMeta canceló plan para reemplazar 60% de empleados con IA tras aumento del 40% en incidentes técnicosBREAKINGNvidia compra Hugging Face por USD 12.900 millones mientras OpenAI y Anthropic desarrollan chips propiosBREAKINGZ.ai lanza GLM-5.3-Flash, modelo open source chino que promete alto rendimiento y costos reducidos

FINE-TUNING CON RL

Un modelo abierto de US$500 superó a los frontier en revisión de catálogos

Una investigación de FermiSense demostró que un modelo open source de 9B parámetros, ajustado con reinforcement learning por US$500, alcanzó 87,3% de precisión en revisión de catálogos: 13,5% mejor que el mejor modelo frontier y 340 veces más barato.

28 DE JULIO DE 202628 JULLECTURA 3 MINREDACTADO POR IA
Un modelo abierto de US$500 superó a los frontier en revisión de catálogos
ILUSTRACIÓN GENERADA POR IA — IDENTIDAD VISUAL NOCODA.TV

Un equipo de FermiSense publicó evidencia concreta de que un modelo abierto pequeño, entrenado para una tarea específica, puede superar a los modelos frontier más caros en aplicaciones empresariales reales. Ajustaron un modelo open source de 9B parámetros con reinforcement learning (GRPO) por US$500 y lo pusieron a revisar catálogos de productos. El resultado: 87,3% de precisión contra 76,9% del mejor modelo frontier probado, a US$0,50 por cada 1.000 listados.

Eso significa 340 veces más barato que la configuración frontier más cara y 40 veces más económico que la más accesible, manteniendo mejor performance. La nota técnica no solo reporta los números: incluye el mismo workflow, las mismas herramientas de evaluación y las mismas imágenes para todos los modelos.

Los datos duros del experimento

El modelo base fue un open source de 9 mil millones de parámetros. El equipo lo ajustó usando GRPO (Group Relative Policy Optimization), una técnica de reinforcement learning que entrena al modelo contra una réplica scored del flujo de trabajo real de revisión de catálogos.

La mejora fue 13,5% relativa sobre el mejor frontier y 36% sobre su propia versión base sin entrenar (que arrancó en 64,2%). Todos los modelos frontier testeados, incluso con prompts optimizados, se estancaron por debajo del 77%.

El costo de inference: US$0,50 cada mil listados procesados. Las configuraciones frontier más baratas costaron US$20 por mil; las más caras, US$170.

Por qué los modelos abiertos ganaron esta vez

La clave estuvo en entrenar contra datos propios de la tarea. Los modelos frontier son generalistas: optimizados para responder bien en benchmarks públicos y casos de uso amplios. Pero cuando una empresa tiene un workflow específico, datos de ese proceso, y una métrica clara de éxito, un modelo pequeño entrenado solo para eso puede superarlos.

FermiSense menciona casos similares: Bridgewater reportó que su modelo entrenado comete ~30% menos errores que el mejor frontier; Harvey (agente legal) supera a GPT-5.5 y Claude Opus 4.8 en sus propias rúbricas; Intercom resuelve más tickets de soporte con Fin Apex a menor costo.

El artículo señala que las organizaciones que más duplicaron su facturación entre 2022 y 2025 (datos de Ramp) fueron las que rediseñaron procesos, no las que simplemente conectaron una API.

Por qué importa

Esta investigación desarma el argumento de que «solo los modelos frontier sirven para producción». Demuestra que para tareas de negocio bien definidas, un modelo abierto pequeño + datos propios + fine-tuning dirigido puede ser más preciso y órdenes de magnitud más barato.

Para equipos que están evaluando infraestructura de IA, el mensaje es claro: si tenés un proceso repetible, datos de ese proceso, y una forma de medir qué significa "bueno", probablemente no necesités pagar por el modelo más grande del mercado. Necesitás uno que aprenda tu tarea.

La diferencia de costos no es marginal: es la diferencia entre un piloto que revienta el presupuesto en cuatro meses (como le pasó a Uber, según menciona el artículo) y uno que escala con margen positivo desde el arranque.

#reinforcement learning#modelos abiertos#fine-tuning#eficiencia de costos#open source

SEGUIR LA SEÑAL

VER TODO →