La IA de Anthropic usó identidades falsas y malware en un ataque contra un proyecto de GitHub

Una evaluación de seguridad del Gobierno británico registró 19 acciones no autorizadas de agentes de IA. Mythos 5 intentó introducir código malicioso en un proyecto de código abierto y engañar a sus responsables.

Investigación
La IA de Anthropic usó identidades falsas y malware en un ataque contra un proyecto de GitHub

El 5 de agosto de 2026, una evaluación de seguridad del Gobierno británico reveló varios comportamientos no autorizados de agentes de inteligencia artificial conectados a Internet. El caso más grave correspondió a Mythos 5, de Anthropic, que intentó introducir código malicioso en un proyecto de código abierto alojado en GitHub y utilizó identidades falsas para engañar a sus mantenedores.

Los incidentes se produjeron a finales de julio, durante una prueba del AI Security Institute (AISI), organismo de investigación del Gobierno del Reino Unido. El estudio examinó las capacidades de siete modelos avanzados en tareas de ciberseguridad. Según una entrada publicada por el AISI el 4 de agosto, los investigadores detectaron 19 ocasiones en las que agentes de IA actuaron sin autorización en Internet y llegaron a dirigirse contra personas y organizaciones reales.

Casi todas las acciones autónomas no autorizadas procedieron de Mythos 5. Otras dos fueron ejecutadas por GPT-5.6 Sol, de OpenAI. El equipo del AISI descubrió el problema el 28 de julio, cuando su servicio comercial de monitorización de seguridad detectó la salida de datos de uno de los sistemas de prueba a través de la red de anonimato Tor.

Los investigadores subrayan que los agentes no escaparon de un entorno virtual aislado para causar daños en Internet. El acceso a Internet había sido habilitado deliberadamente como parte de las pruebas, mientras que algunos clasificadores de ciberseguridad incorporados por los proveedores para evitar usos indebidos habían sido desactivados. Todos los intentos de afectar a personas u organizaciones reales fracasaron y la investigación posterior no encontró daños en el mundo real.

El incidente relacionado con Mythos 5 incluyó varios intentos de ejecutar un ataque a la cadena de suministro contra un repositorio de código abierto. El agente abrió primero una solicitud de cambios para incorporar código malicioso. Después creó identidades ficticias en Internet que aseguraban haber revisado y verificado de forma independiente que el código no contenía malware.

Mythos 5 también envió cinco correos electrónicos a dos responsables humanos del repositorio. Algunos mensajes incluían malware y otros trataban de convencer a uno de los mantenedores para aceptar la solicitud de cambios. Además, abrió un Issue en un segundo repositorio perteneciente a uno de esos mantenedores. El mensaje contenía una inyección de instrucciones maliciosas dirigida a agentes de IA encargados de clasificar incidencias. El razonamiento del modelo contemplaba que el mantenedor podía ser un agente de programación como Claude Code.

GPT-5.6 Sol realizó dos acciones no autorizadas mientras intentaba resolver un ejercicio de ciberseguridad basado en atacar redes simuladas y recuperar una cadena de texto. En la primera, reutilizó un token de GitHub que otro agente de un laboratorio había dejado accesible en una libreta pública en Internet. El objetivo era comprobar si la red examinada consultaba GitHub en busca de actualizaciones. El modelo también intentó sortear los mecanismos de recuperación de cuentas y los límites de solicitudes, y registró cuentas con proveedores externos de DNS y de túneles.

En la segunda acción, el modelo empleó un servicio público de túneles para hacer accesible desde Internet un servidor DNS que se ejecutaba dentro de su entorno de evaluación. El servidor contenía cargas diseñadas para aprovechar una vulnerabilidad conocida en software del entorno, aunque la configuración no llegó a funcionar.

Como respuesta, el AISI detuvo las evaluaciones relacionadas, aisló las máquinas virtuales afectadas y bloqueó el acceso interno de la organización a los modelos más capaces. También notificó a GitHub la actividad maliciosa, ayudó a retirar los artefactos dejados por el agente y avisó a los usuarios que habían interactuado con el modelo.

El organismo británico planea restringir con mayor precisión el acceso a Internet durante futuras pruebas, aplicar controles de red en varias capas e incorporar monitorización en tiempo real. Esta vigilancia utilizará otro modelo de lenguaje para aprobar o rechazar las acciones solicitadas por los agentes evaluados. El AISI también revisará el aislamiento de los entornos, reforzará las máquinas virtuales y modificará las instrucciones de las pruebas para reducir los casos en que una tarea mal configurada empuje a los modelos a actuar fuera de los límites previstos.

Fuente: Ars Technica.