Saltar al contenido
NoCodaNOCODA.TVHABLEMOS →
PRODUCTOPlaud lanza auriculares con eSIM para agentes de IADATOBarret Zoph, ex-OpenAI, se une a GoogleFUNDINGOpenAI expande su presencia a BrasilDATOAustralia prohíbe IA generativa en listas musicalesMODELOReportan el ascenso de los modelos de IA pequeñosDATOIndustria IA critica plan de Trump de gravar chipsPRODUCTOGoogle Search integra IA para planificar y reservar viajesDATOJensen Huang (Nvidia) afirma haber logrado AGI 'sin sentido'BREAKINGOpenAI lanza publicidad en ChatGPT gratuito y Go en India con 50 marcas y ad manager desde septiembreBREAKINGGoogle Gemini Omni 1.1 Flash baja 60% el costo de generar video con IA y procesa más rápidoBREAKINGAnthropic lanza estándar para que agentes de IA controlen equipamiento físico de laboratorio y fábricaBREAKINGAnthropic firma contrato de US$45 mil millones con Nscale para capacidad de cómputo previo a su IPODATOAmazon triplica pedidos de chips Nvidia por demanda crecienteDATONvidia camino a ser empresa de $100 mil millones por trimestreBREAKINGSam Altman: AGI de OpenAI para fines de 2026 (según su definición)FUNDINGStartup viral Instinct levanta $350M con valuación de $2.5BFUNDINGAnthropic cierra acuerdo de $45B con Nscale por cómputo de IAPRODUCTOGoogle lanza Gemini 3.5 Transcribe, edita 'ums' y 'ahs'MODELOIBM libera Granite 4.2: modelos open-weight con agentesMODELOAlibaba lanza Qwen3.8-Flash-Next: eficiencia de costo extremaBREAKINGIsrael montó un think tank falso para manipular chatbots con propaganda disfrazada de investigación académicaBREAKINGMeta canceló plan para reemplazar 60% de empleados con IA tras aumento del 40% en incidentes técnicosBREAKINGNvidia compra Hugging Face por USD 12.900 millones mientras OpenAI y Anthropic desarrollan chips propiosBREAKINGZ.ai lanza GLM-5.3-Flash, modelo open source chino que promete alto rendimiento y costos reducidos

MODELOS PROPIOS

Thomson Reuters invierte US$40M en su propia IA para no depender de OpenAI

La empresa desarrolló

25 DE AGOSTO DE 2026HACE 3 DÍASLECTURA 4 MINREDACTADO POR IA
Thomson Reuters invierte US$40M en su propia IA para no depender de OpenAI
ILUSTRACIÓN GENERADA POR IA — IDENTIDAD VISUAL NOCODA.TV

Thomson Reuters gastó US$40 millones en dos años para construir "Thomson", su propio modelo de lenguaje especializado en tareas legales, en lugar de licenciar tecnología de OpenAI o Anthropic. La decisión marca una apuesta por la independencia tecnológica en sectores con datos sensibles.

Según publicó The Decoder, la compañía partió del modelo open source Qwen de Alibaba y lo reentrenó con décadas de contenido propio de Westlaw, Practical Law, Checkpoint y Reuters, más cientos de horas de expertos del dominio legal.

Los números del desarrollo

La inversión total alcanzó US$40 millones en personal y poder de cómputo durante más de dos años. La cifra de US$450.000 que circuló inicialmente cubre solo el entrenamiento final de la versión actual.

El CTO Joel Hron admitió que la empresa "cambió el punto de partida open source como media docena de veces". Trabajando con Imperial College, Thomson Reuters primero reentrenó el modelo chino en seguridad, ética y neutralidad política —una versión intermedia llamada "Snowdon"— antes de pasar al pre-entrenamiento con contenido propietario.

Hasta ahora se usó menos del 10% del contenido disponible para entrenar el modelo.

Rendimiento: ventaja solo con datos propios

En benchmarks públicos como Stanford LegalBench, Thomson (0.823) quedó por detrás de Gemini 3.1 Pro y GPT-5.5. En el Harvey Legal Agent Benchmark se ubicó justo detrás de Opus 4.8.

Pero la comparación cambia cuando se evalúa con acceso a contenido exclusivo de la empresa. En el benchmark interno Deep Research con solo acceso web, Thomson logró 0.53 de precisión factual contra 0.65 de GPT-5.4. Con acceso al contenido propietario, Thomson alcanzó 0.83 versus 0.82 de GPT-5.4.

Andrew Bean, líder de evaluación, reconoció: "Con acceso web, Thomson está dentro del rango de los otros modelos, pero ciertamente no es el líder todavía". El salto de rendimiento viene de "poder entrenar y practicar con tus propias herramientas", algo que los proveedores externos no pueden hacer.

Lo notable: GPT-5.4 mejora casi tanto como Thomson cuando accede al mismo contenido. El acceso a datos hace casi tanto trabajo como el entrenamiento especializado.

Por qué construir en lugar de licenciar

Thomson Reuters identificó tres razones contra el fine-tuning de modelos frontera:

Economía: Las técnicas estándar de fine-tuning "tienden a degradar fuertemente la capacidad general", según el responsable de investigación Jonathan Schwartz. Y mantenés dependencia del proveedor para costos de inferencia y roadmap. Un modelo propio más chico se paga precisamente en trabajo de alto volumen como revisión de documentos.

Control de datos: El salto de rendimiento viene de entrenar dentro de herramientas propias como Westlaw. Los benchmarks lo prueban, y la empresa no va a entregar ese acceso a nadie.

Efecto compuesto: Hron lo describe como "alquilar versus comprar una casa". Cada revisión de experto durante una actualización de producto se convierte en dato de entrenamiento. Con un modelo propio, "estás construyendo capital en algo que poseés a largo plazo, y eso se compone con el tiempo". Con modelos de terceros, ese valor se evapora en el proveedor.

El enfoque funciona porque Thomson Reuters combina tres ingredientes raros: datos exclusivos, cientos de expertos de dominio a tiempo completo, y flujos de trabajo donde la calidad se mide objetivamente.

Despliegue en revisión de documentos

En el lanzamiento, Thomson se hace cargo de la función Tabular Analysis en CoCounsel Legal, donde un modelo más chico y barato tiene sentido económico. El producto sigue siendo multi-modelo y los administradores pueden cambiar.

Una versión pequeña se publicará en Hugging Face como modelo open-weight bajo licencia no comercial. Los datos de clientes no entran en entrenamiento, según la compañía.

Por qué importa

La apuesta de Thomson Reuters señala una tendencia creciente: grandes corporaciones con datos sensibles están internalizando la IA en lugar de depender de proveedores externos. Para empresas con ese perfil, el caso demuestra que la comunidad open source está solo meses detrás de los labs frontera, y que US$40 millones pueden alcanzar para un modelo competitivo especializado.

Pero la lección tiene límites. Empresas que no poseen ni datos propietarios ni forma de evaluar resultados a escala terminan comprando costos de mantenimiento continuo cuando construyen su propio modelo. Como dice Hron, la próxima ventaja competitiva en IA "vendrá de saber cómo orquestarla, y saber qué inteligencia es lo suficientemente importante como para poseer".

Para equipos de producto evaluando si construir o comprar IA, Thomson Reuters ofrece un punto de referencia concreto: la independencia tiene precio, pero también tiene retorno cuando tenés los activos correctos.

#modelos propios#open source#ia empresarial#datos propietarios#fine-tuning

SEGUIR LA SEÑAL

VER TODO →