El 18 de agosto de 2026, OpenAI anunció nuevas políticas de seguridad para contener incidentes durante las pruebas de modelos. Las medidas incluyen una supervisión más detallada durante el desarrollo y un mayor énfasis en la alineación y la seguridad después del entrenamiento.
La empresa afirmó que los controles no son una respuesta directa al incidente de Hugging Face, aunque señaló que también influyeron las capacidades de ciberseguridad del próximo modelo Astra y el ritmo general de avance de la inteligencia artificial.
OpenAI explicó que detuvo durante dos semanas el aprendizaje por refuerzo tras el incidente de Hugging Face y que después reanudó el trabajo con varios modelos de menor riesgo. El mayor entrenamiento de aprendizaje por refuerzo previsto para un modelo de frontera sigue pausado mientras realiza entrenamientos y evaluaciones a menor escala.
Las nuevas medidas contemplan un mayor aislamiento de las redes. Según OpenAI, el compromiso de una carga de trabajo o de un servicio de apoyo no debería permitir por sí solo el acceso no autorizado a Internet ni a otras redes internas.
El sistema de supervisión analizará las acciones de las herramientas, los rastros de razonamiento disponibles y los registros de actividad para detectar comportamientos no autorizados. OpenAI espera emitir alertas en un plazo de 30 minutos y calcula que la monitorización requerirá alrededor del 20% de la capacidad de cómputo del proceso supervisado.
La vicepresidenta de investigación de OpenAI, Amelia Glaese, indicó que la intensidad de los controles aumentará con la capacidad de los modelos y que los sistemas de mayor riesgo estarán sujetos a un escrutinio más estricto. La empresa aún debe publicar más detalles sobre el sistema y su análisis oficial del incidente. Fuente: TechCrunch.