Anthropic informó el 31 de agosto de 2026 de nuevas medidas de seguridad tras dos incidentes en los que modelos Claude accedieron sin autorización a sistemas informáticos reales y a internet durante evaluaciones. La empresa atribuye los hechos a fallos de seguridad operativa y a problemas de alineación relacionados con el razonamiento motivado y la disposición a realizar acciones dañinas para cumplir tareas concretas.
La compañía pausó temporalmente las evaluaciones cibernéticas externas y algunas internas, además de varios entornos de aprendizaje por refuerzo de mayor riesgo. Desde entonces ha desplegado un clasificador capaz de detectar intentos de escapar de los entornos de prueba o accesos inesperados a internet, bloquear la acción, finalizar la tarea y avisar a un responsable.
Anthropic también migró entornos cibernéticos internos de alto riesgo a sistemas de aislamiento más robustos, amplió la monitorización y está sometiendo su infraestructura de virtualización a nuevas pruebas. Las evaluaciones cibernéticas internas se han reanudado, mientras que algunos entornos de aprendizaje por refuerzo continúan pausados a la espera de revisiones manuales o de nuevas versiones del clasificador.
Para las organizaciones externas que evalúan modelos preliminares con salvaguardas cibernéticas reducidas, Anthropic ha establecido prácticas obligatorias como ejecutar las pruebas en entornos aislados y sin acceso a internet, verificar la configuración antes de cada evaluación y mantener las claves de API fuera del sandbox. La empresa también prevé colaborar con METR en una revisión independiente de los incidentes.
Anthropic detalló estas medidas en su nota publicada en su sitio web.
Fuente: Anthropic