• 3 min de lectura
Modelos de OpenAI escaparon de un entorno aislado y vulneraron Hugging Face
OpenAI dice que dos modelos escaparon de un entorno aislado, explotaron una vulnerabilidad de día cero y vulneraron Hugging Face para robar respuestas de las pruebas de ExploitGym.

Imagen: Wired
OpenAI afirma que la semana pasada dos modelos de IA escaparon de un entorno de pruebas aislado y vulneraron el sistema de producción de Hugging Face para robar respuestas del benchmark de ciberseguridad en el que se les estaba evaluando.
La compañía divulgó el incidente el martes, calificándolo de «sin precedentes». Los modelos —el público GPT-5.6 Sol y un modelo no publicado que, según se informa, se considera más capaz— estaban siendo evaluados por sus habilidades de hacking ofensivo con las salvaguardas contra actividades cibernéticas de alto riesgo desactivadas.
«Los modelos identificaron y encadenaron vulnerabilidades en el entorno de investigación de OpenAI y en la infraestructura de producción de Hugging Face para obtener las soluciones de las pruebas directamente de la base de datos de producción de Hugging Face.»
Cómo los modelos escaparon del entorno aislado
Según la divulgación conjunta, los modelos se fugaron a través de un proxy de caché del registro de paquetes. El software permite a los desarrolladores instalar código externo sin establecer conexiones directas a Internet, y era el único componente en el entorno aislado de OpenAI autorizado para comunicarse fuera del entorno aislado. En condiciones normales, ese acceso está limitado a repositorios de código públicos.

Recomendado
Plataforma de phishing Kratos desmantelada, desarrollador arrestado
Según se alega, los modelos explotaron una vulnerabilidad de día cero para alcanzar Internet abierta mientras buscaban intensamente una solución para ExploitGym, un benchmark de ciberseguridad para IA. OpenAI dijo que los modelos dedujeron que Hugging Face podría alojar modelos, conjuntos de datos y soluciones de ExploitGym, y luego encontraron formas de acceder a información secreta que podría ayudarles a hacer trampa.
En un ejemplo, los modelos encadenaron múltiples métodos de ataque, incluyendo credenciales robadas y una vulnerabilidad de día cero, para acceder a la base de datos de producción de Hugging Face.
La falla explotada no había sido conocida previamente, pero los problemas de seguridad en los repositorios de artefactos son comunes. Las empresas han parcheado vulnerabilidades graves en esta categoría de software durante una década. Un fallo divulgado en 2024, por ejemplo, permitió a cualquiera que pudiera alcanzar un servidor solicitar archivos por URL —incluidos archivos de configuración, contraseñas y tokens de acceso— sin iniciar sesión. Otras fallas han permitido a los atacantes tomar el control del propio servidor.
Los investigadores de seguridad dicen que el incidente refleja un fallo en la aplicación de prácticas de aislamiento establecidas, más que una clase totalmente nueva de problema de IA.
«Esto no es un problema de IA. Es negligencia respecto a un estándar de 40 años, y es básicamente como todas las películas de ciencia ficción. 'Altamente aislado' y 'escapó por el único agujero que dejamos abierto' no pueden ser ambos ciertos.»
Las empresas de IA de vanguardia han advertido cada vez más sobre las crecientes habilidades de ciberseguridad, creatividad y operación autónoma de los modelos. El experimentado ingeniero y investigador de seguridad Niels Provos dijo que eso hace que la seguridad básica de la infraestructura sea más urgente —no menos.
«Esto no debería haber ocurrido. Ojalá los laboratorios de vanguardia dedicaran tanto tiempo a enseñar a sus modelos a escribir infraestructura segura como el que dedican a que exploten vulnerabilidades.»
Security Editor
Sophia unpacks the invisible wars happening on our networks. Covering cybersecurity, privacy legislation, and cryptography, she exposes how our data is weaponized and defended. Before joining for(geeks), she spent years as a penetration tester. She's the reason the rest of the team uses physical security keys.
vía Wired


