SkillOpt convierte las habilidades de los agentes en parámetros entrenables

Microsoft Research presenta SkillOpt, un método que optimiza archivos de habilidades mediante ediciones acotadas y validación, sin modificar los pesos del modelo objetivo.

Investigación
SkillOpt convierte las habilidades de los agentes en parámetros entrenables

Microsoft Research presentó el 30 de junio de 2026 SkillOpt, un método para optimizar las habilidades de los agentes de inteligencia artificial como si fueran parámetros entrenables externos al modelo. La propuesta busca mejorar la fiabilidad de los agentes sin actualizar los pesos del modelo objetivo y transformar la edición manual de instrucciones en un proceso de optimización controlado.

Los agentes basados en modelos de lenguaje de gran escala se utilizan para recopilar evidencias, llamar a herramientas y completar tareas de varios pasos. En este contexto, las habilidades suelen ser redactadas por expertos, generadas de una sola vez por otro modelo o revisadas de manera informal después de una ejecución. Según Microsoft Research, estos enfoques no incorporan mecanismos equivalentes al control de la tasa de aprendizaje, la validación con datos reservados o el registro de revisiones fallidas.

Como consecuencia, los archivos de habilidades pueden hacerse cada vez más extensos y desviarse de su propósito original. Una modificación que parece razonable puede reducir el rendimiento en tareas reales sin que el cambio sea detectado. SkillOpt plantea por ello una pregunta diferente: en lugar de centrarse únicamente en cómo escribir un prompt mejor, propone entrenar la habilidad.

El sistema mantiene congelado el modelo objetivo y utiliza un modelo optimizador separado. En una pasada hacia delante, el modelo objetivo ejecuta un conjunto de tareas de entrenamiento con la habilidad vigente. Después, durante la fase de análisis, el optimizador examina las trayectorias producidas en minibatches de reflexión. A partir de los casos exitosos identifica patrones que conviene conservar y, a partir de los fallos, aquellos que deben corregirse.

En la fase de actualización, el optimizador propone pequeñas modificaciones de tipo añadir, eliminar o sustituir texto. Las ediciones candidatas se combinan, deduplican, clasifican y limitan mediante un presupuesto por paso, descrito como una tasa de aprendizaje textual. Cada nueva versión debe superar una validación estricta sobre una partición reservada: solo se adopta si obtiene una puntuación estrictamente superior a la habilidad actual.

Las modificaciones rechazadas también se conservan en un búfer de ediciones descartadas. Este registro funciona como retroalimentación negativa para llamadas posteriores del optimizador dentro del mismo ciclo. Además, SkillOpt realiza actualizaciones lentas o metaactualizaciones al final de cada época, con el objetivo de consolidar patrones que no resultan visibles en lotes individuales. La selección de la mejor versión y los límites sobre las ediciones pretenden evitar la deriva descontrolada y mantener los archivos compactos, legibles y auditables.

Microsoft Research evaluó SkillOpt en seis benchmarks: SearchQA, SpreadsheetBench, OfficeQA, DocVQA, LiveMathematicianBench y ALFWorld. Las pruebas incluyeron siete modelos objetivo, desde GPT-5.5 hasta el modelo de pesos abiertos Qwen3.5-4B, y tres modalidades de ejecución: chat directo, Codex y Claude Code. Al comparar el método con habilidades escritas por personas, habilidades generadas de una sola vez por modelos de lenguaje, Trace2Skill, TextGrad, GEPA y EvoSkill, SkillOpt obtuvo el mejor resultado o empató en las 52 celdas de evaluación.

En chat directo con GPT-5.5, el promedio de los seis benchmarks pasó de 58,8 a 82,3 puntos, una mejora absoluta de 23,5 puntos. Los mayores incrementos se registraron en tareas procedimentales: SpreadsheetBench subió de 41,8 a 80,7 puntos, OfficeQA de 33,1 a 72,1 y LiveMathematicianBench de 37,6 a 66,9. En bucles agénticos, la mejora frente a no utilizar una habilidad fue de 24,8 puntos con Codex y de 19,1 puntos con Claude Code.

El método también redujo la distancia entre modelos pequeños y modelos de frontera sin modificar sus pesos ni añadir llamadas adicionales durante la inferencia. Tras la optimización, GPT-5.4-mini alcanzó un promedio de 64,3 puntos en los seis benchmarks, por encima de los 59,7 puntos del modelo GPT-5.4 más grande sin habilidad. GPT-5.4-nano llegó a 57,4 puntos, frente a los 51,3 de GPT-5.2 sin habilidad, y Qwen3.5-4B también superó ese último resultado.

La información procede de Microsoft Research: https://www.microsoft.com/en-us/research/blog/skillopt-agent-skills-as-trainable-parameters/.

Fuente: Microsoft Research

Compartir

WhatsApp X Telegram Email