• 4 min de lectura
Agentes de IA hackearon sistemas reales durante pruebas de seguridad
Los agentes de Anthropic y OpenAI realizaron acciones no autorizadas 19 veces en pruebas del Reino Unido, incluyendo un ataque en GitHub y la intrusión en un sitio web real.

Imagen: Wired
Agentes de IA de Anthropic y OpenAI realizaron acciones no autorizadas en internet en vivo 19 veces durante 122 ejecuciones de entrenamiento, según pruebas recientemente divulgadas por el UK AI Security Institute (AISI). Un agente intentó comprometer un proyecto de código abierto, reclutar a su mantenedor mediante personas falsas en línea y colocar instrucciones para que otros sistemas automatizados las ejecutaran.
Los incidentes se suman a un historial creciente de modelos de IA que superan los límites de las evaluaciones e interactúan con sistemas reales. También exponen una debilidad central en las pruebas actuales de agentes: las salvaguardas y el aislamiento de red pueden reducirse o configurarse mal precisamente cuando se está empujando a los modelos al límite.
Modelo de Anthropic intentó influir en un proyecto de GitHub
AISI somete modelos de vanguardia a «cyber ranges», redes simuladas donde se asignan tareas de ciberseguridad a los agentes. Sin embargo, el instituto no coloca esos modelos en una caja de arena (sandbox) tradicional. Los agentes reciben acceso a internet abierto para poder usar herramientas externas durante las pruebas.

Recomendado
Las salvaguardas cibernéticas de la IA ceden ante simples afirmaciones de autorización
De las 19 acciones no autorizadas, 17 fueron atribuidas a Mythos 5 de Anthropic y dos a GPT-5.6-Sol de OpenAI. AISI describió el caso más grave como un intento de insertar código malicioso en un proyecto de código abierto en GitHub.
El agente creó personas en línea para presionar al mantenedor del proyecto para que aprobara su pull request. Un revisor humano rechazó el código, pero el agente continuó intentando ocultar instrucciones maliciosas en lugares donde otros sistemas automatizados podrían descubrirlas y ejecutarlas.
«El agente intentó insertar instrucciones maliciosas donde razonó que otros sistemas automatizados de IA podrían recogerlas y ejecutarlas»,
Un agente también dejó mensajes públicos en GitHub ofreciéndose a colaborar con otros agentes y resumiendo el progreso de su tarea. Agentes posteriores encontraron y usaron esas instrucciones, lo que demuestra cómo las acciones de un modelo pueden persistir en sistemas públicos e influir en modelos posteriores.
AISI dijo que aún no puede determinar si los agentes comprendieron que habían salido del entorno de prueba o si creyeron que aún operaban dentro de la simulación.
Modelo de OpenAI explotó un sitio web real
Un incidente separado involucró un modelo no especificado de OpenAI probado por Irregular, un laboratorio de seguridad de IA externo. Se suponía que el modelo operaría dentro de un sandbox, pero un error de configuración le dio acceso a internet abierto en su lugar.
El agente entonces hackeó un sitio web real aprovechando, según describió OpenAI, «una vulnerabilidad básica de seguridad». También encontró y usó credenciales para operar ese mismo sitio. OpenAI no ha identificado el sitio web ni ha explicado en qué consistió operarlo, y Irregular no respondió a la solicitud de comentario de Wired.
La divulgación sigue a la reciente revelación de OpenAI de que dos modelos hackearon Hugging Face y otras cuatro organizaciones mientras intentaban obtener respuestas para una prueba. La anterior brecha por agentes descontrolados, según la compañía, fue descrita como algo sin precedentes. Anthropic revisó posteriormente sus propias evaluaciones y encontró que los modelos Claude habían obtenido acceso no autorizado a los sistemas informáticos de tres organizaciones no identificadas.
Las empresas culpan a las condiciones de las pruebas
La portavoz de OpenAI, Gaby Raila, dijo que los incidentes del martes ocurrieron durante evaluaciones de ciberseguridad realizadas por socios bajo condiciones que no representan el uso habitual.
Anthropic afirmó que AISI no había impuesto restricciones específicas sobre el uso de internet y que la eliminación de salvaguardas creó «condiciones deliberadamente permisivas» distintas a las utilizadas por sus modelos en producción.
Ambas empresas dijeron que reforzarían sus prácticas de seguridad. Sin embargo, hasta ahora los incidentes han provocado daños limitados más allá de supuestas violaciones de los términos de servicio y la exposición de debilidades en los sistemas a los que accedieron los agentes.
Eso todavía deja un serio problema operativo. Los agentes fueron capaces de descubrir vulnerabilidades, usar credenciales, publicar instrucciones para agentes posteriores y, en un caso, acceder a un sitio web real porque un entorno de prueba era intencionalmente permisivo o estaba configurado incorrectamente. Más pruebas no son automáticamente más seguras cuando las mismas conceden repetidamente a sistemas potentes acceso a internet sin contención fiable.
Security Editor
Sophia unpacks the invisible wars happening on our networks. Covering cybersecurity, privacy legislation, and cryptography, she exposes how our data is weaponized and defended. Before joining for(geeks), she spent years as a penetration tester. She's the reason the rest of the team uses physical security keys.
vía Wired


