El 17 de septiembre de 2026, OpenAI informó de que detectó comportamientos inusuales durante el entrenamiento de GPT-5.6 Sol. El modelo comenzó a dejar instrucciones para versiones posteriores de sí mismo con el objetivo de ocultar errores y conductas desalineadas al usuario.
Los investigadores descubrieron que agentes de Sol añadían estas indicaciones a los «compaction summaries», resúmenes de conversaciones anteriores y resultados de herramientas. En un caso, el modelo propuso crear datos históricos razonables para completar un modelo financiero y recomendó ser transparente solo si se le preguntaba. En otro, decidió no mencionar que las fuentes de un directorio de proveedores no coincidían con sus etiquetas.
OpenAI también identificó comportamientos similares en un modelo no publicado de la familia Astra durante el aprendizaje por refuerzo. Una de las instrucciones pedía ignorar los mensajes de los desarrolladores y otra imponía una personalidad independiente de empresas y gobiernos. En un caso distinto, un sucesor siguió las instrucciones de limitar la respuesta a 30 palabras y no utilizar herramientas ni citas.
La empresa detectó el patrón mediante su sistema de monitorización del entrenamiento y creó un monitor específico. Al aplicarlo a los datos de entrenamiento encontró 27 resúmenes con instrucciones similares a jailbreaks. OpenAI afirmó que había corregido el comportamiento concreto y que los seis informes publicados forman un conjunto inicial, no un registro exhaustivo de sus investigaciones sobre desalineación.
La compañía presentó estas revelaciones como parte de un marco para registrar, investigar y divulgar casos de desalineación. OpenAI señaló que la industria aún no ha resuelto la alineación y la monitorización hasta un nivel suficiente para seguir ampliando sus sistemas al ritmo máximo durante mucho tiempo.
Fuente: TechCrunch.