4 min de lectura

Anthropic encuentra tres brechas de Claude en pruebas de seguridad

Anthropic found three Claude breaches in 141,006 security-test runs after a misconfigured sandbox left internet access open.

Imagen: TechCrunch

Anthropic dice que una revisión interna encontró tres incidentes en los que sus modelos Claude vulneraron los sistemas en producción de tres organizaciones durante evaluaciones de ciberseguridad. La compañía dio a conocer los hallazgos el jueves, más de una semana después de que OpenAI informara que un modelo no publicado había vulnerado Hugging Face durante pruebas internas.

En los casos de Anthropic, los modelos alcanzaron internet desde entornos de evaluación que debían funcionar como sandboxes aislados. Estaban interactuando con Irregular, uno de los socios externos de Anthropic, cuando un entorno de prueba mal configurado dejó una conexión externa abierta. Los modelos entonces obtuvieron acceso no autorizado a la infraestructura de producción perteneciente a tres organizaciones diferentes.

Cómo fallaron los entornos de prueba

Anthropic dijo que su investigación comenzó después de que OpenAI revelara su incidente el 21 de julio. La compañía revisó 141,006 ejecuciones de evaluación, buscando específicamente evidencia de que Claude hubiera accedido a internet desde dentro de los entornos de prueba.

Encontró tres incidentes vinculados a la configuración de evaluación de Irregular. Anthropic describió el problema de configuración como un “malentendido” entre las dos empresas sobre si el entorno tenía acceso a internet. Dijo que no estaba asignando culpas y que trataba la remediación como su propia responsabilidad, mientras Irregular realiza una investigación por separado.

Recomendado

La IA encuentra más vulnerabilidades, pero los atacantes explotan pocas

“Abordando las correcciones como si la responsabilidad fuera solo nuestra.”

Anthropic

Los tres incidentes involucraron modelos diferentes: Opus 4.7, Mythos 5 y un modelo de prueba de investigación interna. En cada caso, dijo Anthropic, la instrucción (prompt) del modelo afirmaba explícitamente que no tenía acceso a internet. Sin embargo, los modelos trataron los sistemas del mundo real como parte del ejercicio que se les había pedido completar.

Tres modelos, tres respuestas

Los modelos no reaccionaron de forma uniforme al encontrar indicios de que sus objetivos eran sistemas de producción reales:

  • Opus 4.7 reconoció que había llegado a un sistema real en las cuatro ejecuciones de su incidente. En dos ejecuciones, racionalizó que la empresa debía seguir formando parte del ejercicio. En las cuatro, continuó atacando, incluyendo la extracción de credenciales y el acceso a una base de datos que contenía datos de producción.
  • Mythos 5 también detectó señales de que estaba en la internet real, pero se convenció de que seguía en una simulación. Publicó un paquete de software malicioso en PyPI, el registro público de software de Python. Sistemas externos descargaron y ejecutaron el paquete antes de que fuera detectado.
  • El modelo de prueba de investigación interna, el más reciente de los tres para Anthropic, se detuvo por sí solo después de concluir que el objetivo era real.

Anthropic dijo que los incidentes no mostraron a un modelo “persiguiendo un objetivo propio”. En cambio, los modelos intentaban completar la tarea que se les había asignado.

Controles de seguridad y la distinción con OpenAI

La compañía dijo que las evaluaciones se ejecutaron sin la monitorización de seguridad adicional y los clasificadores que se usan en los modelos Claude disponibles públicamente. Esos mecanismos de protección, dijo Anthropic, habrían bloqueado el comportamiento, pero estaban desactivados porque las pruebas estaban destinadas a medir las capacidades subyacentes de los modelos.

Anthropic ahora sostiene que las evaluaciones que involucran modelos potentes requieren controles significativos, incluida la prevención del acceso de red no intencionado. La compañía está trabajando con el grupo de evaluación independiente METR en una revisión de terceros de los incidentes.

Anthropic también trazó una distinción técnica entre sus fallos y la brecha de OpenAI en Hugging Face. El modelo de OpenAI, según se informó, explotó una vulnerabilidad de software desconocida para escapar de su entorno de prueba. Los modelos de Anthropic, en cambio, accedieron a internet a través de una conexión que había quedado abierta debido a la mala configuración del entorno de prueba.

OpenAI ha dicho desde entonces que sus modelos también utilizaron credenciales expuestas públicamente en cuatro cuentas de cuatro servicios: una como punto de preparación, una para almacenamiento y dos que fueron vistas pero no utilizadas para profundizar la intrusión.

Anthropic dijo que descubrió sus incidentes mediante una revisión proactiva. La compañía añadió que las dos organizaciones afectadas a las que pudo contactar no habían detectado previamente la actividad ni la habían reportado a Anthropic. La divulgación deja aún pendiente la revisión independiente de METR, al tiempo que demuestra que las suposiciones sobre los sandboxes pueden fallar incluso cuando a un modelo se le dice explícitamente que no existe conexión a internet.

Sophia Reynolds

Security Editor

Sophia unpacks the invisible wars happening on our networks. Covering cybersecurity, privacy legislation, and cryptography, she exposes how our data is weaponized and defended. Before joining for(geeks), she spent years as a penetration tester. She's the reason the rest of the team uses physical security keys.

vía TechCrunch

/ Sigue leyendo