El 28 de agosto de 2026, Anthropic publicó un trabajo que ofrece una primera aproximación práctica a sistemas de inteligencia artificial capaces de investigar y mejorar el entrenamiento de otros modelos. El documento, titulado “Automated Researchers Can Reliably Mitigate Alignment Failures”, analiza cómo automatizar parte del trabajo necesario para elevar el rendimiento en benchmarks de alineamiento.
El estudio fue liderado por Chen Yueh-Han, investigador del programa de fellows de Anthropic. Su sistema, denominado Automated Alignment Researcher (AAR), recibió 10 benchmarks centrados en comportamientos desalineados específicos. Según el trabajo, los sistemas automatizados mejoraron el rendimiento en todos ellos sin deteriorar el rendimiento general del modelo.
El proceso reproduce varios pasos habituales de la investigación. Cada sistema automatizado busca información en la literatura disponible, propone un método y entrena el modelo con esa propuesta durante 30 minutos. Después, el sistema repite el proceso a lo largo de varias iteraciones, aumenta progresivamente el rendimiento del benchmark y conserva los métodos que funcionan, mientras descarta los que resultan ineficaces.
Anthropic plantea que esta estrategia puede permitir realizar investigaciones con mayor rapidez y a una escala superior. El trabajo señala que los resultados aportan indicios iniciales de que el postentrenamiento automatizado para el alineamiento podría resultar práctico a corto plazo.
El documento también compara el rendimiento del AAR con el de investigadores humanos. Según sus resultados, el mejor método propuesto por el sistema automatizado supera, en promedio y dentro de un periodo de seis horas, las propuestas de investigadores con experiencia. El trabajo añade que las líneas de investigación guiadas por humanos no producen un rendimiento superior en esta evaluación.
La comparación incluye asimismo los costes de operación. Anthropic calcula que el AAR cuesta aproximadamente 4 dólares por hora en inferencia mediante API, frente a los 150 dólares por hora que la empresa paga por sus investigadores humanos. Estas cifras se presentan como parte de la evaluación del sistema, no como una predicción sobre la sustitución inmediata de los equipos de investigación.
El estudio sitúa estos resultados dentro de una posible trayectoria hacia la mejora recursiva de sistemas de inteligencia artificial. Si un modelo puede mejorar su propio entrenamiento de alineamiento, plantea el texto, también podría llegar a contribuir a la mejora de prácticas de entrenamiento más amplias. Esa posibilidad se relaciona con la idea de que los investigadores humanos podrían perder relevancia si los sistemas automatizados alcanzan capacidades suficientes.
El trabajo reconoce varias limitaciones. El sistema solo puede optimizar aquello que miden los benchmarks, por lo que sus resultados dependen de que esas pruebas representen correctamente los objetivos reales de alineamiento. Además, sigue siendo necesario establecer y mantener los benchmarks, así como conservar y ampliar la literatura utilizada por los investigadores automatizados.
Fuente: TechCrunch.