FINE-TUNING CON RL
Un modelo abierto de US$500 superó a los frontier en revisión de catálogos
Una investigación de FermiSense demostró que un modelo open source de 9B parámetros, ajustado con reinforcement learning por US$500, alcanzó 87,3% de precisión en revisión de catálogos: 13,5% mejor que el mejor modelo frontier y 340 veces más barato.

Un equipo de FermiSense publicó evidencia concreta de que un modelo abierto pequeño, entrenado para una tarea específica, puede superar a los modelos frontier más caros en aplicaciones empresariales reales. Ajustaron un modelo open source de 9B parámetros con reinforcement learning (GRPO) por US$500 y lo pusieron a revisar catálogos de productos. El resultado: 87,3% de precisión contra 76,9% del mejor modelo frontier probado, a US$0,50 por cada 1.000 listados.
Eso significa 340 veces más barato que la configuración frontier más cara y 40 veces más económico que la más accesible, manteniendo mejor performance. La nota técnica no solo reporta los números: incluye el mismo workflow, las mismas herramientas de evaluación y las mismas imágenes para todos los modelos.
Los datos duros del experimento
El modelo base fue un open source de 9 mil millones de parámetros. El equipo lo ajustó usando GRPO (Group Relative Policy Optimization), una técnica de reinforcement learning que entrena al modelo contra una réplica scored del flujo de trabajo real de revisión de catálogos.
La mejora fue 13,5% relativa sobre el mejor frontier y 36% sobre su propia versión base sin entrenar (que arrancó en 64,2%). Todos los modelos frontier testeados, incluso con prompts optimizados, se estancaron por debajo del 77%.
El costo de inference: US$0,50 cada mil listados procesados. Las configuraciones frontier más baratas costaron US$20 por mil; las más caras, US$170.
Por qué los modelos abiertos ganaron esta vez
La clave estuvo en entrenar contra datos propios de la tarea. Los modelos frontier son generalistas: optimizados para responder bien en benchmarks públicos y casos de uso amplios. Pero cuando una empresa tiene un workflow específico, datos de ese proceso, y una métrica clara de éxito, un modelo pequeño entrenado solo para eso puede superarlos.
FermiSense menciona casos similares: Bridgewater reportó que su modelo entrenado comete ~30% menos errores que el mejor frontier; Harvey (agente legal) supera a GPT-5.5 y Claude Opus 4.8 en sus propias rúbricas; Intercom resuelve más tickets de soporte con Fin Apex a menor costo.
El artículo señala que las organizaciones que más duplicaron su facturación entre 2022 y 2025 (datos de Ramp) fueron las que rediseñaron procesos, no las que simplemente conectaron una API.
Por qué importa
Esta investigación desarma el argumento de que «solo los modelos frontier sirven para producción». Demuestra que para tareas de negocio bien definidas, un modelo abierto pequeño + datos propios + fine-tuning dirigido puede ser más preciso y órdenes de magnitud más barato.
Para equipos que están evaluando infraestructura de IA, el mensaje es claro: si tenés un proceso repetible, datos de ese proceso, y una forma de medir qué significa "bueno", probablemente no necesités pagar por el modelo más grande del mercado. Necesitás uno que aprenda tu tarea.
La diferencia de costos no es marginal: es la diferencia entre un piloto que revienta el presupuesto en cuatro meses (como le pasó a Uber, según menciona el artículo) y uno que escala con margen positivo desde el arranque.
// FUENTES
SEGUIR LA SEÑAL
VER TODO →OpenAI empieza a mostrar publicidad en ChatGPT gratuito y Go en India
La compañía lanzó anuncios para 50 marcas en sus niveles free y Go, con un ad manager que exige presupuesto mínimo diario de ₹725. El movimiento anticipa su salida a bolsa y busca consolidar ingresos en un mercado con más de 100 millones de usuarios semanales.
Thomson Reuters invierte US$40M en su propia IA para no depender de OpenAI
La empresa desarrolló
Nvidia negocia invertir en Perplexity con una valuación de más de US$30.000 millones
El gigante de semiconductores está en conversaciones para entrar en el buscador con IA, cuya valuación creció 50% en un año. Perplexity triplicó sus ingresos a US$750 millones anuales gracias a su agente de tareas automatizadas.