Liquid AI presenta LFM2.5-2.6B para ejecutar agentes localmente

Liquid AI publica LFM2.5-2.6B, un modelo de 2.6B de parámetros diseñado para agentes locales, con llamadas a herramientas, flujos de varios pasos y soporte para ordenadores y teléfonos.

Modelos
Liquid AI presenta LFM2.5-2.6B para ejecutar agentes localmente

Liquid AI ha publicado el 4 de agosto de 2026 LFM2.5-2.6B, un modelo compacto de 2.6B de parámetros diseñado para ejecutar agentes directamente en dispositivos. El sistema incorpora llamadas a herramientas y flujos de trabajo de varios pasos, con el objetivo de funcionar en equipos que van desde ordenadores portátiles hasta teléfonos.

La compañía sostiene que el modelo puede competir con sistemas de hasta cuatro veces su tamaño en uso de herramientas, seguimiento de instrucciones y tareas agénticas de varios pasos. Su diseño busca mantener los datos en el dispositivo y evitar los costes de inferencia en la nube en despliegues de gran volumen.

LFM2.5-2.6B se preentrenó con aproximadamente 34 billones de tokens y cuenta con una ventana de contexto ampliada hasta 128K tokens. Liquid AI convirtió posteriormente el modelo base en un sistema orientado a agentes mediante cuatro etapas: dos rondas de ajuste supervisado con una fuerte presencia de datos de uso de herramientas, búsquedas web y trayectorias de agentes; profesores especializados por dominios; destilación de esos profesores en un único modelo; y aprendizaje por refuerzo agéntico.

En esta última fase, el modelo se entrenó en entornos de agentes reales y con tareas de varios turnos, herramientas y mensajes de sistema diferentes. La infraestructura separa la optimización del modelo, la inferencia y la ejecución del entorno. Un servicio Sandbox ejecuta las acciones, mientras que un Blackbox Harness aloja el agente y coordina su interacción con el entorno. El Harness Proxy permite utilizar esos armazones sin modificarlos y captura las trayectorias necesarias para reconstruir y validar las muestras de entrenamiento.

En las evaluaciones incluidas por Liquid AI, LFM2.5-2.6B obtuvo mejores resultados que los modelos Gemma y Qwen comparados en varios indicadores de seguimiento de instrucciones. Marcó 59,17 en IFBench, 80,07 en Multi-IF y 85,49 en IFStruct. En uso de herramientas alcanzó 77,83 en ToolSandbox y 56,88 en BFCLv4; en esta última prueba, solo Qwen3.5-9B quedó por encima, según la tabla publicada.

El modelo también logró 62,85 puntos de media en Claw-Eval en inglés y 26,89 en BrowseComp+ con OpenClaw. En matemáticas, obtuvo 51,87 en AIME25, mientras que en programación alcanzó 59,41 en LiveCodeBenchv6. Liquid AI señala que los modelos de mayor tamaño mantienen una ventaja clara en código, aunque LFM2.5-2.6B se mantiene cerca en conocimiento y matemáticas y compite con los sistemas Qwen en tareas agénticas.

La eficiencia de inferencia es uno de los principales argumentos del lanzamiento. Liquid AI registró una velocidad de decodificación de 220 tokens por segundo en un Apple M5 Max y de 113 tokens por segundo en una CPU AMD Ryzen AI Max+ 395, con un consumo inferior a 2,5 GB de memoria. La compañía indica que una velocidad de 30 tokens por segundo permite ejecutar agentes en un teléfono. En GPU, el modelo llega a casi 15.000 tokens de salida por segundo con alta concurrencia, equivalente, según sus cálculos, a alrededor de 1.300 millones de tokens diarios en una H100.

LFM2.5-2.6B dispone desde el primer día de compatibilidad con llama.cpp, MLX, vLLM, SGLang y ONNX. Liquid AI también ha publicado LFM2.5-2.6B-Base en Hugging Face y ofrece una demostración WebGPU para ejecutarlo en el navegador. Además, proporciona guías para integrarlo en agentes locales como OpenClaw, Hermes Agent y Pi.

La información procede del artículo de Hugging Face publicado por Liquid AI: “Deploy local agents everywhere with LFM2.5-2.6B”.

Fuente: Hugging Face