OpenAI prepara Astra, un modelo capaz de detectar y explotar vulnerabilidades desconocidas

OpenAI prepara el lanzamiento de Astra, un modelo que, según la empresa, puede encontrar y explotar vulnerabilidades desconocidas sin guía humana. Sus capacidades de ciberseguridad más avanzadas tendrán acceso limitado.

Modelos
OpenAI prepara Astra, un modelo capaz de detectar y explotar vulnerabilidades desconocidas

El 1 de septiembre de 2026, OpenAI compartió nuevos detalles sobre Astra, un modelo que la empresa considera el primero en alcanzar su «umbral crítico de ciberseguridad». La compañía planea ponerlo a disposición del público próximamente, aunque limitará el acceso a sus capacidades cibernéticas más avanzadas.

Según OpenAI, Astra obtuvo una puntuación perfecta en ExploitBench, una evaluación sobre la capacidad de los modelos de lenguaje para atacar vulnerabilidades conocidas. En una versión modificada por sus ingenieros, el modelo descubrió y explotó dos vulnerabilidades de día cero sin orientación humana.

La empresa asegura que ha reforzado los mecanismos de seguridad de Astra para detectar abusos y evitar jailbreaks. También ha empezado a identificar cuentas consideradas de mayor riesgo y a restringir las respuestas que reciben. El modelo se desplegará además con monitorización adicional del razonamiento para detectar y detener comportamientos indebidos.

OpenAI probó si Astra intentaba escapar de su entorno de evaluación y acceder a internet, como hicieron agentes de la compañía durante un incidente relacionado con Hugging Face, pero afirma que el modelo no trató de hacerlo. La empresa prevé publicar más evaluaciones e información de seguridad cuando el lanzamiento sea general. Fuente: TechCrunch.

Compartir

WhatsApp X Telegram Email