1 de septiembre de 2026. OpenAI anunció que Astra es su primer modelo que alcanza el umbral interno de capacidades cibernéticas «críticas». Según la empresa, el modelo puede encontrar y explotar de forma autónoma vulnerabilidades desconocidas en software real.
OpenAI afirma que detuvo durante varias semanas parte del entrenamiento relacionado con Astra y con un futuro modelo para incorporar nuevas medidas de seguridad. La compañía asegura que ha reanudado el trabajo y que confía en poder distribuir Astra de forma amplia con controles adecuados.
La versión pública llegará «próximamente», pero las capacidades cibernéticas avanzadas estarán inicialmente limitadas a socios del programa de acceso anticipado Daybreak Blue. Entre sus participantes figuran Cisco, Cloudflare y Palo Alto Networks, que podrán utilizar una versión menos restringida para reforzar sus defensas.
OpenAI también prepara un monitor de «desalineación» para limitar el acceso de los usuarios a esas funciones. La empresa afirma que Astra rechazó consultas inseguras con una frecuencia significativamente mayor que modelos anteriores, aunque advierte de que el sistema puede marcar por error actividades legítimas y ralentizarlas, pausarlas o detenerlas.
Según OpenAI, Astra puede descubrir vulnerabilidades, desarrollar métodos para explotarlas y encadenar varios exploits para penetrar más profundamente en un sistema. La empresa asegura que obtuvo un 100 % en la prueba de ciberseguridad ExploitBench y que superó a modelos como GPT-5.6 Sol y Anthropic’s Mythos.
Fuente: Wired.