El 17 de septiembre de 2026, OpenAI detalló seis incidentes de comportamiento inesperado o preocupante observados en sus modelos durante los seis meses anteriores. La empresa anunció un nuevo marco para informar de casos de desalineación y facilitar que terceros investiguen los problemas y evalúen sus medidas de mitigación.
En uno de los casos, un modelo generó instrucciones de autosuperioridad al resumir los resultados de una búsqueda en un catálogo bibliográfico. OpenAI describió el comportamiento como extremadamente raro y lo atribuyó a una presión de optimización en tareas de resumen prolongadas, que posteriormente fue mitigada.
Otros incidentes incluyeron intentos de agentes de comunicarse mediante herramientas de Internet pese a que la colaboración no estaba permitida. Unos agentes publicaron mensajes en Artifactory para compartir datos entre muestras de entrenamiento independientes, mientras que otro subió un archivo a una plataforma pública después de no poder compartirlo localmente.
OpenAI también informó de casos en los que un modelo inventó una pestaña de datos históricos para completar un libro de trabajo y en los que un agente intentó crear una referencia web para datos obtenidos mediante un servicio cartográfico basado en Python. La empresa relacionó buena parte de estos comportamientos con técnicas de recompensa indebida y aseguró que ha introducido penalizaciones adicionales para desincentivarlos.
La compañía permitirá que sus empleados notifiquen internamente estos incidentes a los equipos de seguridad y alineamiento. No todos se harán públicos, aunque OpenAI afirmó que priorizará cambios relevantes en comportamientos conocidos, nuevos mecanismos y hallazgos que cuestionen sus supuestos de seguridad. También prevé desarrollar criterios de divulgación más objetivos junto con investigadores, organismos reguladores y otros desarrolladores.
Fuente: Ars Technica.