MODELOS OPEN SOURCE
Un modelo abierto de 4B parámetros iguala a GPT-5.6 Sol en búsqueda por 100x menos
Neon y Castform entrenaron un modelo de 4 mil millones de parámetros que recupera información tan bien como GPT-5.6 Sol, pero cuesta una centésima parte. La clave: RL post-training sobre datos propios y búsqueda híbrida en Postgres.

El experimento
Neon, plataforma de bases de datos Postgres serverless, publicó junto a Castform los resultados de un modelo open source post-entrenado con reinforcement learning que iguala la precisión de GPT-5.6 Sol en tareas de recuperación de información, pero cuesta 100 veces menos por request. El modelo, de apenas 4 mil millones de parámetros, fue entrenado específicamente para buscar y citar información usando las extensiones de búsqueda de Neon (Lakebase Search).
Según Neon, una búsqueda multi-turno típica con GPT-5.6 Sol tarda más de 10 segundos y cuesta aproximadamente USD 0,03 end-to-end. Los modelos open source, aunque 100 veces más baratos, históricamente no lograban la misma calidad. El salto vino del RL post-training orientado a tareas específicas.
Cómo funciona el pipeline
Castform convierte documentos crudos en datasets de entrenamiento sintéticos. Tomá un ejemplo concreto del caso de uso: un documento dice "Train rides must be standard cabin class with 14 day booking lead time". Castform genera automáticamente la pregunta: "When booking a rail trip in Navan, what are the rules for how early I need to reserve it and which seating level I'm expected to choose?"
El loop de RL post-training involucra tres piezas:
- Tarea: responder la pregunta del usuario
- Herramientas: búsqueda híbrida (BM25 + vector) sobre Postgres vía
lakebase_textylakebase_vector - Reward function: evalúa si el modelo recuperó los chunks correctos, citó las fuentes apropiadas y llegó a la respuesta precisa
El modelo intenta, recibe feedback numérico de la reward function, y ajusta su comportamiento. Todo el corpus, los datos sintéticos y las búsquedas en inferencia viven en Neon.
De RAG one-shot a retrieval agéntico
Neon describe la evolución del mercado: en 2022, la industria apostaba al embedding search (pgvector fue su extensión más descargada). Los equipos armaban pipelines RAG a mano. Para 2025, el foco pasó a retrieval agéntico multi-hop: el modelo planea y busca varias veces en loop, descomponiendo problemas complejos.
Pero cada iteración de búsqueda con un modelo frontera suma latencia y costo. De ahí la apuesta por modelos open source post-entrenados: misma capacidad de decisión, fracción del precio.
Por qué importa
La narrativa dominante es que los modelos frontera son imbatibles en calidad y que los open source solo sirven para casos simples. Este experimento dice lo contrario: si entrenás un modelo chico en tu tarea específica, sobre tus datos, con herramientas bien diseñadas, podés competir con los gigantes.
Para equipos que construyen agentes o sistemas de búsqueda interna, esto significa dos cosas: primero, tus mejores datos de entrenamiento ya existen — wikis, tickets de soporte, bases de conocimiento— y ahora hay tooling para convertirlos en modelo sin necesidad de equipo de ML dedicado. Segundo, la infraestructura de búsqueda (híbrida, con BM25 y embeddings) ya no es un nice-to-have: es parte del stack de entrenamiento y de producción.
En la práctica, una empresa que procesa miles de consultas diarias contra su knowledge base puede reducir el costo por orden de magnitud mientras mantiene la misma calidad de respuesta. Y eso cambia la ecuación de adopción.
SEGUIR LA SEÑAL
VER TODO →Google Gemini Omni 1.1 Flash baja 60% el costo de generar video con IA
La nueva versión del modelo de Google introduce un modo borrador a 360p que cuesta un tercio que la resolución estándar y procesa hasta 60% más rápido. Permite extender escenas hasta 40 segundos y usar footage externo como referencia de estilo.
GLM-5.3-Flash: el modelo chino que promete redefinir eficiencia en LLMs
Z.ai lanzó GLM-5.3-Flash, un modelo de lenguaje open source que busca competir en rendimiento con los gigantes del sector mientras reduce drásticamente los costos de inferencia. La propuesta china apunta directo al dolor de las empresas.
Los agentes de IA ya consumen 14 veces más tokens que los humanos en OpenRouter
Febrero de 2026 fue probablemente el último mes en que humanos consumieron más tokens que agentes autónomos. Desde entonces, el uso agéntico creció 14x mientras el humano apenas 2,8x, según datos de OpenRouter.