5 min de lectura

Thomson Reuters afirma que su modelo supera a GPT-5.5

Thomson Reuters afirma que su nuevo modelo Thomson supera a GPT-5.5 en benchmarks seleccionados y debutará en CoCounsel Legal en agosto.

Imagen: Hacker News

Thomson Reuters afirma que su nuevo modelo Thomson es competitivo con los principales sistemas de vanguardia, incluido Claude Opus 4.8, y que supera a GPT-5.5, Claude Sonnet 5 y Gemini 3.1 Pro en evaluaciones seleccionadas. La compañía planea lanzarlo a finales de este verano, con su primer despliegue en producción programado para agosto.

Cómo se desarrolló Thomson

Thomson Reuters adquirió la empresa de investigación en IA Safe Sign Technologies en 2024. En lugar de confiar únicamente en modelos de propósito general cada vez más capaces, la compañía dice que desarrolló un modelo específicamente para dominios profesionales, normas y requisitos de responsabilidad.

Thomson parte de una base de código abierto para capacidades de propósito general. Thomson Reuters aplicó luego técnicas de entrenamiento intermedio y posentrenamiento usando décadas de contenido de Westlaw, Practical Law, Checkpoint y Reuters. Cientos de expertos en la materia evaluaron las salidas, documentaron modos de fallo y validaron si el razonamiento del modelo reflejaba cómo trabajan los profesionales del derecho.

Recomendado

Robot de Qualcomm se derrumba durante demostración tras pérdida de conexión

La compañía afirma que los datos de los clientes nunca se utilizan para entrenar el modelo. También sostiene que Thomson ofrece un rendimiento comparable al de modelos mucho más grandes mientras requiere una fracción de su tamaño y de sus costes de entrenamiento y operación. Según la empresa, hasta ahora se ha utilizado en el entrenamiento menos del 10% del contenido de Thomson Reuters.

Resultados de benchmarks en tareas legales y generales

Thomson Reuters evaluó Thomson-1-Large frente a Gemini 3.1 Pro de Google DeepMind, Opus 4.8 de Anthropic y GPT-5.5 de OpenAI en categorías legales y de propósito general, incluidas programación, fiscalidad, contabilidad, multilingüismo, periodismo, tareas agentivas, seguridad, contexto largo, razonamiento y seguimiento de instrucciones.

Las puntuaciones publicadas incluyen:

  • Stanford LegalBench: Thomson 0.823; Gemini 3.1 Pro 0.843; Opus 4.8 0.818; GPT-5.5 0.832.
  • PrBench Legal Hard: Thomson 0.352, la puntuación más alta; Gemini 3.1 Pro 0.293; Opus 4.8 0.315; GPT-5.5 0.333.
  • Harvey Legal Agent Benchmark: Thomson 0.857; Gemini 3.1 Pro 0.555; Opus 4.8 0.869; GPT-5.5 0.781.
  • Seguimiento de instrucciones: Thomson 0.914, la puntuación más alta; Gemini 3.1 Pro 0.848; Opus 4.8 0.861; GPT-5.5 0.885.
  • Razonamiento: Thomson 0.684; Gemini 3.1 Pro 0.748; Opus 4.8 0.737; GPT-5.5 0.589.
  • Programación: Thomson 0.399; Gemini 3.1 Pro 0.500; Opus 4.8 0.598; GPT-5.5 0.414.
  • Contexto largo: Thomson 0.753, la puntuación más alta; Gemini 3.1 Pro 0.750; Opus 4.8 0.741; GPT-5.5 0.703.

La imagen del benchmark identifica el mejor resultado de cada fila en verde.

Tabla titulada 'Comparación de benchmarks de modelos' que compara Thomson Reuters Thomson-1-Large, Google DeepMind Gemini 3.1 Pro, Anthropic Opus 4.8 y OpenAI GPT-5.5 en benchmarks de dominio legal y dominio general, con la mejor puntuación de cada fila resaltada en verde. Dominio legal: Stanford LegalBench — Thomson Reuters 0.823, Google DeepMind 0.843 mejor, Anthropic 0.818, OpenAI 0.832. PrBench Legal Hard — Thomson Reuters 0.352 mejor, Google DeepMind 0.293, Anthropic 0.315, OpenAI 0.333. Harvey Legal Agent Benchmark — Thomson Reuters 0.857, Google DeepMind 0.555, Anthropic 0.869 mejor, OpenAI 0.781. Dominio general: Seguimiento de instrucciones — Thomson Reuters 0.914 mejor, Google DeepMind 0.848, Anthropic 0.861, OpenAI 0.885. Razonamiento — Thomson Reuters 0.684, Google DeepMind 0.748 mejor, Anthropic 0.737, OpenAI 0.589. Programación — Thomson Reuters 0.399, Google DeepMind 0.500, Anthropic 0.598 mejor, OpenAI 0.414. Contexto largo — Thomson Reuters 0.753 mejor, Google DeepMind 0.750, Anthropic 0.741, OpenAI 0.703. Notas: Thomson-1-Large usó escalado en tiempo de prueba; Gemini 3.1 Pro y Opus 4.8 usaron modo de razonamiento; GPT-5.5 usó modo sin razonamiento. Pie de foto: 'Comparación directa entre benchmarks de Dominio Legal y Dominio General. La mejor puntuación de cada fila está resaltada en verde.'
Tabla titulada 'Comparación de benchmarks de modelos' que compara Thomson Reuters Thomson-1-Large, Google DeepMind Gemini 3.1 Pro, Anthropic Opus 4.8 y OpenAI GPT-5.5 en benchmarks de dominio legal y dominio general, con la mejor puntuación de cada fila resaltada en verde. Dominio legal: Stanford LegalBench — Thomson Reuters 0.823, Google DeepMind 0.843 mejor, Anthropic 0.818, OpenAI 0.832. PrBench Legal Hard — Thomson Reuters 0.352 mejor, Google DeepMind 0.293, Anthropic 0.315, OpenAI 0.333. Harvey Legal Agent Benchmark — Thomson Reuters 0.857, Google DeepMind 0.555, Anthropic 0.869 mejor, OpenAI 0.781. Dominio general: Seguimiento de instrucciones — Thomson Reuters 0.914 mejor, Google DeepMind 0.848, Anthropic 0.861, OpenAI 0.885. Razonamiento — Thomson Reuters 0.684, Google DeepMind 0.748 mejor, Anthropic 0.737, OpenAI 0.589. Programación — Thomson Reuters 0.399, Google DeepMind 0.500, Anthropic 0.598 mejor, OpenAI 0.414. Contexto largo — Thomson Reuters 0.753 mejor, Google DeepMind 0.750, Anthropic 0.741, OpenAI 0.703. Notas: Thomson-1-Large usó escalado en tiempo de prueba; Gemini 3.1 Pro y Opus 4.8 usaron modo de razonamiento; GPT-5.5 usó modo sin razonamiento. Pie de foto: 'Comparación directa entre benchmarks de Dominio Legal y Dominio General. La mejor puntuación de cada fila está resaltada en verde.'

Thomson Reuters dice que el seguimiento de instrucciones combina los benchmarks IFEval y FollowBench. Razonamiento combina GPQA Diamond, HLE y MMLU-Pro; programación combina SWE-Bench Pro y Terminal-Bench 2.1; y contexto largo combina Infinity Bench con evaluaciones internas de Thomson Reuters.

Las comparaciones no son idénticas en configuración: Thomson-1-Large usó escalado en tiempo de prueba, Gemini 3.1 Pro y Opus 4.8 usaron modo de razonamiento, y GPT-5.5 usó modo sin razonamiento. La fuente presenta estos como evaluaciones de Thomson Reuters; no aporta verificación de terceros de los resultados.

Datos propietarios y pruebas de investigación jurídica

La compañía también probó Thomson con 53 consultas de investigación jurídica redactadas por expertos internos en la materia. En esa evaluación, los modelos se conectaron a Westlaw y Practical Law de Thomson Reuters mediante un arnés agentivo interno, mientras que la investigación web competidora utilizó el motor de búsqueda Brave.

La evaluación midió dos criterios:

  • Completitud: si una respuesta abordaba cada elemento listado en las rúbricas de los expertos en la materia.
  • Factualidad: si las fuentes citadas respaldaban las afirmaciones hechas en cada informe.

Los grandes modelos de lenguaje actuaron como jueces, con las métricas calibradas frente a la puntuación de los expertos en la materia. Thomson Reuters sostiene que el acceso directo a Westlaw, Practical Law y Reuters da a Thomson una ventaja en completitud y factualidad frente a los modelos de vanguardia limitados al acceso a la web sin restricciones.

Imagen de evaluación de Thomson Reuters que muestra su comparación de investigación jurídica usando Westlaw, Practical Law y búsqueda web
Imagen de evaluación de Thomson Reuters que muestra su comparación de investigación jurídica usando Westlaw, Practical Law y búsqueda web

La compañía dice que su proceso más amplio de entrenamiento y evaluación incluye consultas del mundo real escritas por expertos, flujos de trabajo agentivos, entrenamiento de investigación profunda con evaluadores calibrados por humanos, entrenamiento intermedio centrado en datos y red-teaming humano y automatizado. No divulgó el número de parámetros del modelo, el coste de entrenamiento ni el coste operativo.

La primera integración de Thomson llegará en agosto dentro de Tabular Analysis en CoCounsel Legal. La herramienta realiza revisiones de documentos estructuradas y de gran volumen frente a un estándar de precisión medible, lo que, según Thomson Reuters, la convierte en una prueba clara de los beneficios de un modelo específico de dominio.

Thomson será el modelo predeterminado para Tabular Analysis. A lo largo del año siguiente, la compañía planea integrarlo en su cartera de productos legales y fiscales. El anuncio no ofrece un precio independiente para Thomson ni especifica una fecha exacta de lanzamiento en agosto.

Thomson Reuters enmarca el modelo como la cuarta parte de su pila de IA profesional, junto con contenido autoritativo, experiencia en el dominio y herramientas de software. Su estándar declarado es “IA de grado fiduciario™” para profesionales con deberes de diligencia y rendición de cuentas, una justificación para construir un modelo entrenado con contenido propietario en lugar de tratar a un sistema de propósito general como el producto final.

Ava Chen

AI Editor

Ava covers the rapidly evolving world of artificial intelligence, from foundational models and research labs to the real-world economics of intelligence. With a background in computational linguistics, she cuts through the hype to find out what actually works. She firmly believes that benchmarks are just marketing until reproduced in the wild.

vía Hacker News

/ Sigue leyendo