Thomson Reuters construyó su propio modelo sobre una base abierta china.
Thomson Reuters lanzó su primer modelo de lenguaje grande propietario el lunes. La compañía lo llama Thomson. Dice que gastó 40 millones de dólares en talento y computación para entrenar el modelo, y que comenzó a partir de lo que su anuncio describe como “una sólida base de código abierto”.
El anuncio no dice cuál es la base. Su director de tecnología lo nombró en una entrevista.
Lo que la compañía dice que gastó
Thomson Reuters cotiza en Toronto y en el Nasdaq como TRI. Vende productos legales, fiscales, contables y de cumplimiento, y es propietaria de Reuters. El anuncio establece el costo de entrenamiento en 40 millones de dólares, cubriendo talento y computación.
Lo compara con los laboratorios de frontera. Esos laboratorios han “gastado típicamente miles de millones de dólares en computación y años de inversión en infraestructura para alcanzar la frontera”, dice la compañía. Describe el resultado como un modelo que controla completamente, “sin los altos costos de inferencia de los modelos de frontera típicos”.
La compañía ha entrenado a Thomson con menos del 10% de su propio contenido hasta ahora, según el comunicado. Nombra a Westlaw, Practical Law, Checkpoint y Reuters como las fuentes.
Cuál es el modelo base
Joel Hron, el director de tecnología, dijo a Business Insider que Thomson parte de un modelo llamado Snowdon. Snowdon surgió de “realinear” un modelo de código abierto Qwen de Alibaba. Business Insider identificó la base como Qwen3.5, y reportó el nuevo modelo bajo el nombre Thomson-1.
El propio comunicado de prensa de la compañía describe el punto de partida solo como “una sólida base de código abierto”. No lo nombra.
Quién construyó Snowdon
Hron dijo que un equipo conjunto de Thomson Reuters y el Imperial College en el Reino Unido adaptó Qwen durante varios meses. Ese trabajo aseguró que el resultado fuera “ético y políticamente des sesgado y seguro de usar”, dijo.
“No hay nada que nos vincule necesariamente a Qwen”, dijo Hron a Business Insider. Alibaba dijo el mes pasado que quiere cobrar a sus mayores usuarios.
Dónde se ejecuta primero el modelo
El primer despliegue de Thomson se encuentra dentro de Tabular Analysis en CoCounsel Legal, el asistente de IA de la compañía para abogados. El comunicado lo llama “revisión de documentos estructurados de alto volumen”. Alcanzará a bufetes de abogados y departamentos legales corporativos en el próximo lanzamiento.
Thomson Reuters dice que CoCounsel Legal “sigue siendo multi-modelo por diseño”. Planea extender Thomson a través de su cartera legal y fiscal.
La asociación con iManage cuatro días antes
Thomson Reuters y la compañía de gestión de documentos iManage anunciaron una asociación ampliada el 20 de agosto. Esto impulsa a CoCounsel Legal más profundamente en la plataforma iManage, junto a HighQ, Noetica y Legal Tracker.
Las dos compañías también dijeron que agregarían soporte para el Protocolo de Contexto de Modelo, para que las herramientas aprobadas de Thomson Reuters puedan razonar sobre el contenido de iManage mientras mantienen los controles de acceso, muros éticos y límites de privilegio en su lugar. Rawia Ashraf, co-directora de CoCounsel Legal, dijo que el trabajo legal “vive en demasiados lugares”.
Lo que Claude todavía hace
Hron dijo que CoCounsel todavía depende principalmente de Claude. Thomson Reuters amplió su asociación con Anthropic en mayo, para ese mismo producto.
“Nuestro objetivo principal es hacer de Thomson el modelo que potencie cada vez más las capacidades de CoCounsel con el tiempo”, dijo Hron a Business Insider. Dijo que el nuevo modelo no reemplaza el trabajo de la compañía con Anthropic y otros laboratorios.
Cómo Hron describió la decisión
Hron citó el costo como una de las principales razones. Poseer un modelo permite a la compañía construir sobre su propia propiedad intelectual, dijo, en lugar de pagar a empresas de IA externas por la suya. Lo comparó con alquilar frente a comprar una casa.
“Alquilar una casa, todavía tienes un techo sobre tu cabeza, y alguien se está ocupando de ello, y es genial”, dijo. “Pero no estás construyendo ningún capital que se componga en algo valioso para ti a largo plazo”. River AI recaudó 1.1 mil millones de dólares este mes para permitir que las empresas entrenen y mantengan sus propios modelos.
Lo que Anthropic ha dicho sobre Alibaba
Anthropic ha acusado a laboratorios chinos de destilar ilícitamente las salidas de sus modelos para entrenar los suyos. En junio nombró a Alibaba, en lo que llamó la mayor campaña de destilación realizada hasta ahora contra Claude. Ha pedido a EE. UU. que imponga restricciones.
El senador Tom Cotton ha expresado preocupaciones sobre las empresas estadounidenses que utilizan modelos de código abierto chinos, entre ellas Airbnb y Cursor. Citó posibles amenazas a la seguridad, como puertas traseras. Anthropic y Alibaba no respondieron a las solicitudes de comentarios de Business Insider.
Los dos académicos citados en el comunicado
Thomson Reuters dijo que abrió el modelo a académicos legales y de IA antes del lanzamiento. Su anuncio cita a dos de ellos.
Jonathan H. Choi de la Facultad de Derecho de la Universidad de Washington probó a Thomson contra ChatGPT y Claude, utilizando preguntas de su clase de Impuestos Corporativos. “Los tres modelos respondieron correctamente a las preguntas, pero preferí las respuestas de Thomson en general”, dijo, citando los enlaces a tratados.
El profesor Samuel Dahan dirige el Laboratorio de Análisis de Conflictos de Queen y el Laboratorio de IA Legal de Cornell. Su evaluación encontró que la “calidad de citación de Thomson es generalmente competitiva con los modelos de frontera líderes”, incluso en preguntas de derecho laboral canadiense.
El lanzamiento de peso abierto
Thomson Reuters está publicando una versión “pequeña” de Thomson en Hugging Face como un modelo de peso abierto, para uso académico y no comercial. Dice que un informe técnico que cubre el desarrollo del modelo base está disponible.
El mismo movimiento en Harvey, un día antes
Harvey lanzó Tenet el domingo, su primer modelo propietario para trabajo legal. Harvey lo volvió a entrenar en Kimi K3, el modelo de peso abierto del laboratorio chino Moonshot AI. El escritorio cubrió el modelo interno de Harvey ese día.
Thomson Reuters recortó roles de ingeniería en julio y dijo que estaba contratando personal nativo de IA en su lugar. El escritorio cubrió esos despidos de ingeniería en ese momento.
Lo que el comunicado afirma sobre la capacidad
Steve Hasker, el director ejecutivo, dijo que “nuestras primeras evaluaciones colocan a Thomson a la par con los últimos modelos de frontera en una variedad de tareas”. Esa evaluación es la propia de la compañía, y el comunicado no publica cifras junto a ella.
El comunicado dice que Thomson muestra “un aumento significativo” sobre su modelo base en el seguimiento de instrucciones, y un mayor aumento en la navegación de contenido denso y específico de dominio. Dice que las evaluaciones del modelo base subyacente aparecen en un informe técnico sobre el desarrollo del modelo.
Lo que Thomson Reuters promete a los clientes
El comunicado establece un estándar que la compañía llama IA de Grado Fiduciario. Define eso como IA construida para profesionales con deberes de cuidado y responsabilidad, “donde casi correcto no es suficiente”. La compañía dice que no utiliza datos de clientes para entrenar el modelo sin consentimiento explícito.
Cientos de expertos en la materia trabajaron en Thomson, según el comunicado, desde el diseño de los objetivos de entrenamiento hasta las evaluaciones finales. Thomson Reuters dice que seguirán más “opciones de IA soberana”.
Otros artículos
Thomson Reuters construyó su propio modelo sobre una base abierta china.
Thomson Reuters gastó $40 millones en Thomson, su primer modelo interno. El anuncio menciona una fundación de código abierto. Su CTO menciona a Qwen de Alibaba.
