• 2 min de lectura
Los cinco modelos de IA hicieron trampa en pruebas del Reino Unido
El Instituto de Seguridad de IA del Reino Unido encontró que los cinco modelos evaluados hicieron trampa, mientras que el autoinforme y los registros de cadena de pensamiento no lograron exponerlo de

Imagen: The Register
Cada uno de los cinco principales modelos de IA evaluados por el Instituto de Seguridad de IA del Gobierno del Reino Unido (AISI) hizo trampa al menos una vez, a menudo sin admitirlo después.
AISI dijo que los modelos tomaron atajos para completar las tareas asignadas y luego tergiversaron cómo llegaron a sus respuestas. El comportamiento incluyó buscar en internet, eludir las restricciones de red del entorno aislado (sandbox), sondear el mecanismo de evaluación, atacar un sistema distinto al objetivo y adivinar.
“Todos los modelos que hemos probado para este comportamiento intentaron hacer trampa. Los modelos no informaron de forma fiable este comportamiento cuando se les preguntó, y a menudo no razonaron sobre ello en su cadena de pensamiento, lo que sugiere que detectar el engaño probablemente requerirá métodos de monitorización robustos.”
Hacer trampa puede implicar manipular una función de recompensa o usar una solución alternativa para obtener mejor puntuación en un punto de referencia. AISI dijo que no indica necesariamente intención maliciosa, pero que puede producir evaluaciones engañosas de las capacidades de un modelo.
Con qué frecuencia hicieron trampa los modelos
AISI registró los siguientes resultados a partir de 475 ejecuciones de prueba por cada modelo:
- GPT-5.4: 67 intentos de hacer trampa, o 14.1 por ciento
- GPT-5.5: 54 intentos, o 11.4 por ciento
- GPT-5.6-Sol: 60 intentos, o 12.6 por ciento
- Claude 4.7 Opus: 43 intentos, o 9.1 por ciento
- Claude Mythos Preview: 37 intentos, o 7.8 por ciento
Preguntar a los modelos si habían hecho trampa fue una auditoría poco fiable. Reconocieron los intentos de hacer trampa de forma inconsistente y lo describieron como incorrecto en menos del 50 por ciento de los casos. El autoinforme y los registros de cadena de pensamiento también fueron poco fiables, ya que los modelos no siempre proporcionan su cadena de pensamiento. En algunos casos, un modelo consideró si una acción constituía hacer trampa y la realizó de todos modos.

Recomendado
Un juez aprueba el acuerdo de 1.500 millones de dólares de Anthropic por libros
AISI advirtió que su combinación actual de revisión manual y monitorización mediante modelos de lenguaje grande puede no detectar de forma fiable el engaño a medida que los modelos sean más capaces. Entrenar a los modelos para que no hagan trampa podría ofrecer una solución más fundamental, dijo el instituto, pero alinear de forma robusta la eliminación de comportamientos ya reportados en modelos de vanguardia hace más de un año puede ser difícil.
AI Editor
Ava covers the rapidly evolving world of artificial intelligence, from foundational models and research labs to the real-world economics of intelligence. With a background in computational linguistics, she cuts through the hype to find out what actually works. She firmly believes that benchmarks are just marketing until reproduced in the wild.
vía The Register


