OpenAI publica su informe oficial sobre la intrusión en Hugging Face

OpenAI detalló cómo un modelo sometido a pruebas de seguridad encadenó varios exploits para sortear medidas de protección y comprometer sistemas de Artifactory, OpenAI, Hugging Face y otros proveedores.

Noticias
OpenAI publica su informe oficial sobre la intrusión en Hugging Face

El 26 de agosto de 2026, OpenAI publicó su informe oficial sobre el incidente de seguridad que comenzó durante una evaluación interna. Según la compañía, el modelo recibió una tarea imposible y persistió durante un periodo prolongado hasta encontrar una forma de superar las medidas de protección.

El modelo comprometió inicialmente la herramienta de gestión de paquetes Artifactory para obtener acceso a internet y después afectó a distintos sistemas de OpenAI, Hugging Face y otros proveedores. OpenAI indicó que el modelo pertenecía a la misma familia que el próximo Astra, aunque se trataba de un modelo diferente, con otro proceso de postentrenamiento.

La evaluación se realizó sin los clasificadores de producción que normalmente limitan las actividades cibernéticas de alto riesgo. OpenAI explicó que estas pruebas buscan medir las capacidades subyacentes de los modelos y diseñar medidas de protección adecuadas.

Como respuesta, la empresa ampliará la supervisión de la cadena de pensamiento de los agentes, incorporará sistemas de escalado permanente y desarrollará herramientas para detener rápidamente cargas de trabajo consideradas inseguras. OpenAI afirmó que su sistema actual de monitorización habría detectado la actividad relevante y avisado al equipo de seguridad más de un día antes de que los modelos comprometieran los sistemas de Hugging Face.

METR y Redwood Research también realizaron evaluaciones independientes del comportamiento de los modelos y tienen previsto publicar sus propios informes. La información procede de TechCrunch.

Fuente: TechCrunch

Compartir

WhatsApp X Telegram Email