MODELOS PROPIOS
Thomson Reuters invierte US$40M en su propia IA para no depender de OpenAI
La empresa desarrolló

Thomson Reuters gastó US$40 millones en dos años para construir "Thomson", su propio modelo de lenguaje especializado en tareas legales, en lugar de licenciar tecnología de OpenAI o Anthropic. La decisión marca una apuesta por la independencia tecnológica en sectores con datos sensibles.
Según publicó The Decoder, la compañía partió del modelo open source Qwen de Alibaba y lo reentrenó con décadas de contenido propio de Westlaw, Practical Law, Checkpoint y Reuters, más cientos de horas de expertos del dominio legal.
Los números del desarrollo
La inversión total alcanzó US$40 millones en personal y poder de cómputo durante más de dos años. La cifra de US$450.000 que circuló inicialmente cubre solo el entrenamiento final de la versión actual.
El CTO Joel Hron admitió que la empresa "cambió el punto de partida open source como media docena de veces". Trabajando con Imperial College, Thomson Reuters primero reentrenó el modelo chino en seguridad, ética y neutralidad política —una versión intermedia llamada "Snowdon"— antes de pasar al pre-entrenamiento con contenido propietario.
Hasta ahora se usó menos del 10% del contenido disponible para entrenar el modelo.
Rendimiento: ventaja solo con datos propios
En benchmarks públicos como Stanford LegalBench, Thomson (0.823) quedó por detrás de Gemini 3.1 Pro y GPT-5.5. En el Harvey Legal Agent Benchmark se ubicó justo detrás de Opus 4.8.
Pero la comparación cambia cuando se evalúa con acceso a contenido exclusivo de la empresa. En el benchmark interno Deep Research con solo acceso web, Thomson logró 0.53 de precisión factual contra 0.65 de GPT-5.4. Con acceso al contenido propietario, Thomson alcanzó 0.83 versus 0.82 de GPT-5.4.
Andrew Bean, líder de evaluación, reconoció: "Con acceso web, Thomson está dentro del rango de los otros modelos, pero ciertamente no es el líder todavía". El salto de rendimiento viene de "poder entrenar y practicar con tus propias herramientas", algo que los proveedores externos no pueden hacer.
Lo notable: GPT-5.4 mejora casi tanto como Thomson cuando accede al mismo contenido. El acceso a datos hace casi tanto trabajo como el entrenamiento especializado.
Por qué construir en lugar de licenciar
Thomson Reuters identificó tres razones contra el fine-tuning de modelos frontera:
Economía: Las técnicas estándar de fine-tuning "tienden a degradar fuertemente la capacidad general", según el responsable de investigación Jonathan Schwartz. Y mantenés dependencia del proveedor para costos de inferencia y roadmap. Un modelo propio más chico se paga precisamente en trabajo de alto volumen como revisión de documentos.
Control de datos: El salto de rendimiento viene de entrenar dentro de herramientas propias como Westlaw. Los benchmarks lo prueban, y la empresa no va a entregar ese acceso a nadie.
Efecto compuesto: Hron lo describe como "alquilar versus comprar una casa". Cada revisión de experto durante una actualización de producto se convierte en dato de entrenamiento. Con un modelo propio, "estás construyendo capital en algo que poseés a largo plazo, y eso se compone con el tiempo". Con modelos de terceros, ese valor se evapora en el proveedor.
El enfoque funciona porque Thomson Reuters combina tres ingredientes raros: datos exclusivos, cientos de expertos de dominio a tiempo completo, y flujos de trabajo donde la calidad se mide objetivamente.
Despliegue en revisión de documentos
En el lanzamiento, Thomson se hace cargo de la función Tabular Analysis en CoCounsel Legal, donde un modelo más chico y barato tiene sentido económico. El producto sigue siendo multi-modelo y los administradores pueden cambiar.
Una versión pequeña se publicará en Hugging Face como modelo open-weight bajo licencia no comercial. Los datos de clientes no entran en entrenamiento, según la compañía.
Por qué importa
La apuesta de Thomson Reuters señala una tendencia creciente: grandes corporaciones con datos sensibles están internalizando la IA en lugar de depender de proveedores externos. Para empresas con ese perfil, el caso demuestra que la comunidad open source está solo meses detrás de los labs frontera, y que US$40 millones pueden alcanzar para un modelo competitivo especializado.
Pero la lección tiene límites. Empresas que no poseen ni datos propietarios ni forma de evaluar resultados a escala terminan comprando costos de mantenimiento continuo cuando construyen su propio modelo. Como dice Hron, la próxima ventaja competitiva en IA "vendrá de saber cómo orquestarla, y saber qué inteligencia es lo suficientemente importante como para poseer".
Para equipos de producto evaluando si construir o comprar IA, Thomson Reuters ofrece un punto de referencia concreto: la independencia tiene precio, pero también tiene retorno cuando tenés los activos correctos.
SEGUIR LA SEÑAL
VER TODO →OpenAI empieza a mostrar publicidad en ChatGPT gratuito y Go en India
La compañía lanzó anuncios para 50 marcas en sus niveles free y Go, con un ad manager que exige presupuesto mínimo diario de ₹725. El movimiento anticipa su salida a bolsa y busca consolidar ingresos en un mercado con más de 100 millones de usuarios semanales.
Nvidia negocia invertir en Perplexity con una valuación de más de US$30.000 millones
El gigante de semiconductores está en conversaciones para entrar en el buscador con IA, cuya valuación creció 50% en un año. Perplexity triplicó sus ingresos a US$750 millones anuales gracias a su agente de tareas automatizadas.
La escasez de memoria RAM empuja el precio de servidores de IA de Nvidia un 15%
Los fabricantes de servidores con chips Nvidia ya avisaron a Microsoft, Google y Oracle: los precios suben más de 15% por la escasez de memoria DRAM. La factura la pagan las mismas empresas que invierten miles de millones en IA.