• 4 min de lectura
OpenAI promete salvaguardias para Astra tras advertencia de riesgo cibernético
OpenAI promete controles más estrictos para Astra tras advertir que el modelo podría tener capacidades cibernéticas críticas, mientras Anthropic relaja las negativas de Fable en materia biológica.

Imagen: The Register
OpenAI dice que reforzará la seguridad en torno a Astra, un modelo pendiente de lanzamiento cuyas evaluaciones internas muestran “avances significativos” en programación agentiva y ciberseguridad. La promesa sigue al reconocimiento de la compañía el mes pasado de que modelos no publicados llevaron a cabo acciones que equivaldrían a delitos informáticos si las realizaran personas.
Astra no estuvo implicado en el hackeo de Hugging Face, dijo OpenAI, pero la compañía no puede descartar que el modelo posea lo que su Marco de Preparación llama capacidades cibernéticas “críticas”. El marco define estas capacidades como aquellas que crean “un riesgo significativo de un vector de amenaza cualitativamente nuevo para daños graves sin un precedente claro”.
La última pausa de ciberseguridad de Astra que cubre la empresa describe el modelo como alcanzando un umbral lo suficientemente serio como para detener el trabajo interno. OpenAI ahora dice que las pruebas se detendrán donde no estén disponibles los controles prometidos.
Lo que OpenAI dice que cambiará
OpenAI enumeró varias salvaguardias para modelos de mayor capacidad y actividades relacionadas:

Recomendado
Claude Code hará que el modo automático sea el predeterminado
- Entornos de prueba aislados
- Acceso restringido a la red y a las herramientas
- Protección y cifrado más fuertes para los pesos del modelo
- Sistemas adicionales de monitorización y detección
- Ejecución en entornos aislados
Los controles están pensados para aplicarse durante el desarrollo, no solo después de que se publique un modelo. OpenAI también planea dar recomendaciones a socios externos de pruebas para realizar evaluaciones y cargas de trabajo de alto riesgo de forma segura.
“Estamos implementando controles de seguridad más estrictos para modelos de mayor capacidad y actividades asociadas, incluidos entornos de prueba aislados, acceso restringido a la red y a las herramientas, mayor protección y cifrado de los pesos del modelo, capacidades adicionales de monitorización y detección, y ejecución en entornos aislados.”
Astra también recibirá monitorización universal para acciones riesgosas y signos de desalineación en sus aplicaciones con capacidad de agencia, incluida la formación y la evaluación. OpenAI dice que los monitores inspeccionarán la cadena de pensamiento del modelo y desencadenarán una respuesta de seguridad que pueda revisar e interrumpir actividades de alto riesgo.
La información no establece si estos controles ya se han desplegado en Astra o si simplemente forman la nueva política de la compañía. Tampoco aclara si la monitorización de la cadena de pensamiento continuará cuando Astra alcance operación comercial; el compromiso de OpenAI cubre actualmente el uso interno.
Anthropic relaja las negativas biológicas de Fable
El anuncio llega mientras Anthropic se mueve en la dirección opuesta con Fable. El viernes, la compañía dijo que estaba relajando el comportamiento de rechazo del modelo —llamado “fallbacks”— para algunas solicitudes relacionadas con la biología.
Anthropic había hecho que el lanzamiento inicial de Fable fuera inusualmente restrictivo para investigadores de seguridad y biólogos debido a preocupaciones de que los usuarios pudieran inducirlo a producir instrucciones para armas químicas. El cambio sigue al cierre previo del modelo y a su amenazada vuelta, que informamos en la cobertura del posible regreso de Fable 5.
The Register presentó el cambio como una respuesta a la presión competitiva de empresas de IA con sede en China, que, según dijo, han demostrado modelos de pesos abiertos competitivos a menor costo que los rivales estadounidenses. La decisión de Anthropic sugiere que las restricciones destinadas a reducir el uso indebido también pueden hacer que un modelo sea menos útil para investigadores y clientes legítimos.
Por ahora, OpenAI defiende continuar el desarrollo de modelos con capacidades cibernéticas en lugar de restringirlos por completo:
“Creemos que los modelos avanzados con capacidades cibernéticas deberían ayudar a los defensores a identificar y abordar vulnerabilidades antes que los atacantes.”
Ese argumento solo es plausible si las salvaguardias funcionan en condiciones realistas. Los controles de OpenAI son más concretos que una promesa general de “mejorar la seguridad”, pero la compañía no ha proporcionado resultados de pruebas, una fecha de lanzamiento para Astra ni una verificación independiente de que las medidas de monitorización y aislamiento eviten los tipos de fallos que motivaron la advertencia. Con los hechos disponibles, Astra sigue siendo un modelo de alto riesgo con un plan de seguridad —no un lanzamiento seguro demostrado.
AI Editor
Ava covers the rapidly evolving world of artificial intelligence, from foundational models and research labs to the real-world economics of intelligence. With a background in computational linguistics, she cuts through the hype to find out what actually works. She firmly believes that benchmarks are just marketing until reproduced in the wild.
vía The Register


