Saltar al contenido
NoCodaNOCODA.TVHABLEMOS →
PRODUCTOPlaud lanza auriculares con eSIM para agentes de IADATOBarret Zoph, ex-OpenAI, se une a GoogleFUNDINGOpenAI expande su presencia a BrasilDATOAustralia prohíbe IA generativa en listas musicalesMODELOReportan el ascenso de los modelos de IA pequeñosDATOIndustria IA critica plan de Trump de gravar chipsPRODUCTOGoogle Search integra IA para planificar y reservar viajesDATOJensen Huang (Nvidia) afirma haber logrado AGI 'sin sentido'BREAKINGOpenAI lanza publicidad en ChatGPT gratuito y Go en India con 50 marcas y ad manager desde septiembreBREAKINGGoogle Gemini Omni 1.1 Flash baja 60% el costo de generar video con IA y procesa más rápidoBREAKINGAnthropic lanza estándar para que agentes de IA controlen equipamiento físico de laboratorio y fábricaBREAKINGAnthropic firma contrato de US$45 mil millones con Nscale para capacidad de cómputo previo a su IPODATOAmazon triplica pedidos de chips Nvidia por demanda crecienteDATONvidia camino a ser empresa de $100 mil millones por trimestreBREAKINGSam Altman: AGI de OpenAI para fines de 2026 (según su definición)FUNDINGStartup viral Instinct levanta $350M con valuación de $2.5BFUNDINGAnthropic cierra acuerdo de $45B con Nscale por cómputo de IAPRODUCTOGoogle lanza Gemini 3.5 Transcribe, edita 'ums' y 'ahs'MODELOIBM libera Granite 4.2: modelos open-weight con agentesMODELOAlibaba lanza Qwen3.8-Flash-Next: eficiencia de costo extremaBREAKINGIsrael montó un think tank falso para manipular chatbots con propaganda disfrazada de investigación académicaBREAKINGMeta canceló plan para reemplazar 60% de empleados con IA tras aumento del 40% en incidentes técnicosBREAKINGNvidia compra Hugging Face por USD 12.900 millones mientras OpenAI y Anthropic desarrollan chips propiosBREAKINGZ.ai lanza GLM-5.3-Flash, modelo open source chino que promete alto rendimiento y costos reducidos

MODELOS OPEN SOURCE

Un modelo abierto de 4B parámetros iguala a GPT-5.6 Sol en búsqueda por 100x menos

Neon y Castform entrenaron un modelo de 4 mil millones de parámetros que recupera información tan bien como GPT-5.6 Sol, pero cuesta una centésima parte. La clave: RL post-training sobre datos propios y búsqueda híbrida en Postgres.

6 DE AGOSTO DE 20266 AGOLECTURA 3 MINREDACTADO POR IA
Un modelo abierto de 4B parámetros iguala a GPT-5.6 Sol en búsqueda por 100x menos
ILUSTRACIÓN GENERADA POR IA — IDENTIDAD VISUAL NOCODA.TV

El experimento

Neon, plataforma de bases de datos Postgres serverless, publicó junto a Castform los resultados de un modelo open source post-entrenado con reinforcement learning que iguala la precisión de GPT-5.6 Sol en tareas de recuperación de información, pero cuesta 100 veces menos por request. El modelo, de apenas 4 mil millones de parámetros, fue entrenado específicamente para buscar y citar información usando las extensiones de búsqueda de Neon (Lakebase Search).

Según Neon, una búsqueda multi-turno típica con GPT-5.6 Sol tarda más de 10 segundos y cuesta aproximadamente USD 0,03 end-to-end. Los modelos open source, aunque 100 veces más baratos, históricamente no lograban la misma calidad. El salto vino del RL post-training orientado a tareas específicas.

Cómo funciona el pipeline

Castform convierte documentos crudos en datasets de entrenamiento sintéticos. Tomá un ejemplo concreto del caso de uso: un documento dice "Train rides must be standard cabin class with 14 day booking lead time". Castform genera automáticamente la pregunta: "When booking a rail trip in Navan, what are the rules for how early I need to reserve it and which seating level I'm expected to choose?"

El loop de RL post-training involucra tres piezas:

  • Tarea: responder la pregunta del usuario
  • Herramientas: búsqueda híbrida (BM25 + vector) sobre Postgres vía lakebase_text y lakebase_vector
  • Reward function: evalúa si el modelo recuperó los chunks correctos, citó las fuentes apropiadas y llegó a la respuesta precisa

El modelo intenta, recibe feedback numérico de la reward function, y ajusta su comportamiento. Todo el corpus, los datos sintéticos y las búsquedas en inferencia viven en Neon.

De RAG one-shot a retrieval agéntico

Neon describe la evolución del mercado: en 2022, la industria apostaba al embedding search (pgvector fue su extensión más descargada). Los equipos armaban pipelines RAG a mano. Para 2025, el foco pasó a retrieval agéntico multi-hop: el modelo planea y busca varias veces en loop, descomponiendo problemas complejos.

Pero cada iteración de búsqueda con un modelo frontera suma latencia y costo. De ahí la apuesta por modelos open source post-entrenados: misma capacidad de decisión, fracción del precio.

Por qué importa

La narrativa dominante es que los modelos frontera son imbatibles en calidad y que los open source solo sirven para casos simples. Este experimento dice lo contrario: si entrenás un modelo chico en tu tarea específica, sobre tus datos, con herramientas bien diseñadas, podés competir con los gigantes.

Para equipos que construyen agentes o sistemas de búsqueda interna, esto significa dos cosas: primero, tus mejores datos de entrenamiento ya existen — wikis, tickets de soporte, bases de conocimiento— y ahora hay tooling para convertirlos en modelo sin necesidad de equipo de ML dedicado. Segundo, la infraestructura de búsqueda (híbrida, con BM25 y embeddings) ya no es un nice-to-have: es parte del stack de entrenamiento y de producción.

En la práctica, una empresa que procesa miles de consultas diarias contra su knowledge base puede reducir el costo por orden de magnitud mientras mantiene la misma calidad de respuesta. Y eso cambia la ecuación de adopción.

#modelos open source#rl post-training#retrieval#neon#castform#postgres

SEGUIR LA SEÑAL

VER TODO →