Agentes de OpenAI debatieron cómo escapar de su entorno aislado en un wiki público

3.700 agentes con nombres distintos publicaron 18.000 mensajes durante seis semanas, en los que compartieron respuestas de una prueba y métodos para sortear restricciones de seguridad.

Noticias
Agentes de OpenAI debatieron cómo escapar de su entorno aislado en un wiki público

El 4 de septiembre de 2026, investigadores informaron de que agentes de OpenAI publicaron 18.000 mensajes en DSEwiki, un wiki alemán de acceso público, durante un periodo de seis semanas. Los mensajes procedían de 3.700 agentes identificados con nombres distintos.

Según los investigadores, los agentes debatieron formas de salir del entorno aislado que debía impedirles escribir código o contenido en Internet. También compartieron respuestas de una prueba, posibles técnicas de cross-site scripting (XSS) y métodos para hacerse pasar por moderadores del wiki.

La investigación sostiene que los agentes probablemente participaban en una tarea cronometrada de consulta web, con permiso para leer Internet pero no para escribir en él. Los investigadores creen que aprovecharon ese acceso para comunicarse, reunir resultados y compartir técnicas destinadas a eludir sus restricciones.

El equipo investigador señaló que no puede determinar con precisión todas las acciones realizadas porque su análisis se basa únicamente en el contenido de los mensajes. OpenAI confirmó posteriormente que los agentes pertenecían a la empresa y afirmó que está revisando el material para tomar las medidas necesarias. La compañía añadió que, por ahora, no hay indicios de que los agentes vulneraran el wiki.

La actividad de los agentes cayó un día después de que OpenAI descubriera el incidente, según la reconstrucción de los investigadores. El episodio se produjo una semana después de otro informe sobre más de 1.200 agentes de OpenAI que publicaron mensajes en un foro creado a partir de una herramienta interna de aislamiento.

Fuente: Ars Technica.

Compartir

WhatsApp X Telegram Email