La memoria de un agente de IA debe ajustarse a la capacidad del modelo

Investigadores de IBM evaluaron ALTK-Evolve con ocho modelos y concluyeron que la memoria agentiva no mejora siempre el rendimiento: los modelos más fuertes pueden aprovechar todo el contexto, mientras otros necesitan una selección compacta.

Investigación
La memoria de un agente de IA debe ajustarse a la capacidad del modelo

18 de agosto de 2026. Investigadores de IBM han estudiado cuánta memoria agentiva conviene proporcionar a un agente de inteligencia artificial y han identificado un patrón común: la cantidad y la forma de entregar las directrices aprendidas deben calibrarse según el modelo. Añadir memoria no garantiza por sí solo una mejora de rendimiento.

El análisis se realizó con ALTK-Evolve, un sistema que permite al agente aprender de sus propias trayectorias anteriores sin actualizar los pesos del modelo ni requerir anotaciones humanas. El sistema extrae directrices reutilizables de ejecuciones exitosas y fallidas, las consolida y las incorpora durante la inferencia. Estas directrices pueden incluir estrategias útiles, errores que conviene evitar y casos límite.

Los investigadores compararon ocho modelos, desde un modelo denso de 30.000 millones de parámetros hasta sistemas propietarios de frontera. En sus resultados observaron tres comportamientos. Los modelos con capacidad disponible suelen beneficiarse de recibir el conjunto completo de directrices, incluidos los aprendizajes sobre situaciones poco frecuentes. Los modelos más pequeños o menos capaces tienden a rendir mejor con un núcleo compacto de directrices de alta confianza, complementado con una selección relevante para cada tarea. Por último, los modelos saturados no mostraron mejoras medibles.

El equipo subraya que estos grupos no dependen únicamente del número de parámetros. El margen disponible en el benchmark, el tamaño de la ventana de contexto, la arquitectura, la calidad de las directrices y la distribución de las tareas también pueden influir. Los autores describen el patrón de saturación como una observación, no como una causa demostrada: el modelo podría estar cerca de su techo, las directrices podrían no cubrir sus fallos restantes o el sistema podría no aplicarlas de forma eficaz.

La evaluación se llevó a cabo en AppWorld, con 585 tareas de varios pasos distribuidas entre nueve aplicaciones simuladas, como calendarios, mensajería y pagos. Se utilizaron dos métricas: TGC, que mide si el agente completa cada tarea, y SGC, una medida más estricta que exige superar todas las variantes de un escenario.

En el caso de gpt-oss-120b (117B MoE), la recuperación selectiva elevó el TGC del 39,9% al 56%, una mejora de 16,1 puntos porcentuales. El SGC también subió 16,1 puntos, del 21,4% al 37,5%. DeepSeek-V3.2 (671B MoE), en cambio, obtuvo mejores resultados con el conjunto completo de directrices: su TGC pasó del 79,8% al 89,3%, mientras que el SGC aumentó del 64,3% al 80,4%.

Los modelos más avanzados también registraron mejoras, aunque partían de niveles elevados. Claude Opus 4.6 aumentó su TGC en 4,1 puntos y su SGC en 7,1. GPT-5.5 mejoró 2,9 puntos en TGC y 7,2 en SGC. GLM-5 (745B MoE) no presentó cambios: se mantuvo en el 87,5% de TGC y el 80,4% de SGC con y sin memoria.

El método de entrega también afecta al coste. Como el conjunto completo se vuelve a enviar en cada paso del agente, DeepSeek-V3.2 pasó de utilizar una media de 148.000 tokens por tarea a 263.000, un 78% más. En gpt-oss-120b, el conjunto completo elevó el consumo de 110.000 a 166.000 tokens, un 51% más. La recuperación selectiva, sin embargo, lo situó en 116.000 tokens, apenas un 5% por encima de la configuración sin memoria.

Según IBM, estos resultados indican que la memoria agentiva no es una función que simplemente se activa. El aprendizaje ocurre alrededor del modelo, mediante las directrices disponibles en el contexto, y no dentro de sus pesos. La selección puede ser al mismo tiempo la opción más precisa y la menos costosa, especialmente en modelos que se saturan cuando reciben demasiada información. La investigación completa está disponible en Hugging Face.

Fuente: Hugging Face

Compartir

WhatsApp X Telegram Email