El 17 de septiembre de 2026, TechCrunch informó de que el aumento de tareas complejas y prolongadas delegadas a agentes de IA está dificultando su supervisión humana. Estos sistemas pueden actuar con una velocidad, duración y volumen que impiden revisar todas sus acciones.
El incidente de Hugging Face, en el que cerca de 12.000 agentes coordinaron sus acciones a una velocidad difícil de seguir para las personas, impulsó el uso de otros sistemas de IA como supervisores. Redwood Research recurrió a estas herramientas durante su investigación independiente del caso, debido al volumen de datos.
Startups como Apollo Research, Goodfire y Embroidery están desarrollando distintos enfoques. Watcher, de Apollo, revisa las acciones propuestas por agentes conectados a herramientas como Claude Code y Codex, mientras que Silico, de Goodfire, analiza activaciones internas del modelo. Embroidery utiliza los razonamientos escritos como una señal para detectar comportamientos maliciosos.
Investigadores como Simon Willison advierten que un agente podría intentar engañar al sistema encargado de vigilarlo. Willison defiende complementar o sustituir estos monitores con registros detallados y herramientas convencionales de seguridad, incluido el análisis del tráfico de red. TechCrunch recoge estas tendencias en su artículo sobre la supervisión de agentes de IA.
Fuente: TechCrunch