Liquid AI lanza un modelo de 2.6B para agentes que permanecen en el dispositivo
La última LFM de Ramin Hasani apunta a una herramienta que funciona en teléfonos, laptops y computadoras de clase Raspberry Pi, con una salvedad en la licencia para empresas más grandes.
By Ryan Merket · Published
Primary source: VentureBeat
Why it matters
Liquid AI is turning on-device AI into an agent deployment strategy: lower recurring inference costs, local data handling and offline operation, balanced against unverified benchmarks and a commercial license threshold.

Ramin Hasani, el cofundador y CEO de Liquid AI, lanzó un modelo de 2.6 mil millones de parámetros el 4 de agosto diseñado para mover una clase específica de agentes de IA fuera de los servidores en la nube y hacia los teléfonos, laptops y pequeñas computadoras donde se origina su trabajo.
El lanzamiento de LFM2.5-2.6B es la expresión más clara hasta ahora del argumento que Hasani ha perseguido desde que fundó Liquid AI en 2023 con Mathias Lechner, Alexander Amini y Daniela Rus: la IA útil tendrá que ejecutarse fuera de los centros de datos, bajo las limitaciones de memoria, latencia y energía de los dispositivos reales.
Ese grupo fundador proviene del MIT's Computer Science and Artificial Intelligence Laboratory, donde su trabajo en liquid neural networks se centró en construir sistemas computacionales más pequeños para entornos dinámicos. Hasani, quien obtuvo su doctorado en informática en TU Wien, trabajó anteriormente como principal científico de IA y machine learning en Vanguard y realizó investigación postdoctoral con Rus en MIT CSAIL.
LFM2.5-2.6B empaqueta esa agenda de investigación para el mercado de agentes. Liquid AI diseñó el modelo para llamadas a herramientas, extracción de datos, manejo de documentos, automatización de flujos de trabajo y tareas de larga duración en segundo plano. Según su Hugging Face model card, el modelo tiene llamadas nativas a herramientas y una ventana de contexto de 131,072 tokens. Liquid AI también lanzó un checkpoint base para desarrolladores que quieran afinarlos.
En un informe del 6 de agosto, Maxime Labonne, jefe de post-entrenamiento de Liquid AI, dio a la estrategia de producto un límite contundente: "You should use edge AI when you can't use a cloud model."
Ese planteamiento centrado en la restricción es importante. Liquid AI deja la codificación a escala frontera, el trabajo de conocimiento amplio y los trabajos de razonamiento más difíciles a sistemas más grandes. LFM2.5-2.6B está dirigido a trabajo repetitivo y bien definido donde enviar cada prompt, archivo y resultado de herramienta a un modelo remoto aumenta el costo, la demora o el riesgo de privacidad.
Entrenamiento del modelo dentro del software de agentes
Liquid AI dice que preentrenó LFM2.5-2.6B con aproximadamente 34 billones de tokens, duplicó el vocabulario a 128,000 tokens y añadió una fase dedicada de extensión de contexto. Esas son las cifras y descripciones de entrenamiento de Liquid AI.
El cambio más trascendental vino después del preentrenamiento. Liquid AI usó un proceso de cuatro etapas que abarcó fine-tuning supervisado, modelos docentes especialistas, destilación on-policy multi-dominio y aprendizaje por refuerzo agentico. Durante la etapa final, LFM2.5-2.6B operó dentro de arneses de agentes incluidos Hermes Agent y OpenClaw, manejando tareas que requirieron investigación, codificación, gestión documental y herramientas externas.
Entrenar dentro del software que consumirá el modelo aborda un problema práctico para modelos pequeños. Un modelo puede tener buen puntaje en pruebas aisladas de preguntas y respuestas y aun así fallar cuando debe seguir un system prompt, seleccionar una herramienta, formatear un argumento correctamente, leer el resultado y decidir qué hacer después. Liquid AI optimizó para esa secuencia completa.
Las propias evaluaciones de Liquid AI muestran a LFM2.5-2.6B compitiendo con modelos más grandes como Gemma y Qwen en seguimiento de instrucciones, uso de herramientas y varios benchmarks de agentes. Los resultados también muestran el límite que reconoce Liquid AI: los modelos más grandes conservan una ventaja en trabajos exigentes de codificación. Las comparaciones siguen siendo pruebas realizadas por el proveedor, por lo que los desarrolladores necesitarán medir la precisión en la selección de herramientas y la fiabilidad en múltiples pasos con sus propias cargas de trabajo.
El modelo se distribuye con soporte para llama.cpp, MLX, vLLM, SGLang y ONNX, como documenta la documentación de modelos de Liquid AI. El repositorio LEAP-Finetune de Liquid AI cubre la preparación de datasets, entrenamiento distribuido, checkpointing y exportaciones en servidores GPU locales, clústeres Slurm, Modal y entornos Kubernetes.
La inferencia local cambia el modelo de costo de los agentes
Liquid AI reporta que LFM2.5-2.6B genera cerca de 220 tokens por segundo en un Apple M5 Max y 113 tokens por segundo en un AMD Ryzen AI Max+ 395 mientras usa menos de 2.5 GB de memoria. Liquid AI también reporta aproximadamente 30 tokens por segundo en un smartphone y afirma que el modelo corre eficazmente en hardware de clase Raspberry Pi.
Esas mediciones no han sido verificadas de forma independiente. Los resultados exactos dependerán de la cuantización, hardware, longitud de contexto y carga de trabajo. Aun así describen el objetivo comercial: un modelo lo suficientemente pequeño como para permanecer activo sin pagar a un proveedor de nube por cada token generado.
Eso importa sobre todo para agentes que monitorean calendarios, ordenan documentos locales, operan software empresarial o esperan eventos en segundo plano. Su economía se deteriora cuando cada ciclo genera un cargo por API. La ejecución local reemplaza esa factura variable de inferencia con hardware y electricidad ya controlados por el usuario o la empresa.
Liquid AI también mantiene la nube disponible para despliegues de volumen. Liquid AI dice que el mismo modelo puede acercarse a 15,000 tokens de salida por segundo en una sola Nvidia H100 bajo carga concurrente sostenida, equivalente a aproximadamente 1.3 mil millones de tokens por día. La división le da a Hasani dos rutas al mercado: ejecución privada en hardware del cliente y servicio de alto rendimiento donde la infraestructura centralizada aún tiene sentido.
El lanzamiento extiende una línea de productos que se está llenando rápidamente. RuntimeWire informó en mayo que Liquid AI envió LFM2.5-8B-A1B, un modelo mixture-of-experts de 8 mil millones de parámetros con 1.5 mil millones de parámetros activos y una ventana de contexto de 128K. El nuevo lanzamiento de 2.6B avanza más hacia teléfonos y computadoras embebidas mientras retiene el enfoque en llamadas a herramientas.
Liquid AI ya ha vinculado su tesis de nativo en dispositivo con socios de despliegue más grandes. Mercedes-Benz anunció una asociación multianual para desarrollar inteligencia embebida para sistemas de voz y lenguaje en el vehículo. El acuerdo de Shopify con Liquid AI cubre modelos de baja latencia para búsqueda y otras cargas de trabajo de comercio.
Liquid AI cuenta con capital sustancial detrás del esfuerzo. Anunció una Serie A de $250 millones en diciembre de 2024, liderada por AMD, después de revelar $46.6 millones en financiamiento semilla en 2023. La Serie A tenía la intención de financiar cómputo, desarrollo de modelos y herramientas de despliegue para clientes edge y on-premise.
Los pesos abiertos vienen con un umbral de ingresos
Los desarrolladores pueden descargar y modificar LFM2.5-2.6B, aunque los términos de Liquid AI difieren de una licencia open-source permisiva estándar. Bajo la LFM Open License, los derechos comerciales gratuitos terminan cuando la entidad legal del usuario alcanza $10 millones en ingresos anuales. Las empresas por encima de ese umbral deben comprar una licencia comercial a Liquid AI.
Esa provisión da a desarrolladores individuales y startups pequeñas un amplio acceso mientras preserva un negocio de licencias empresariales para Liquid AI. También crea una pregunta temprana de adquisición para compañías que evalúan el modelo frente a alternativas distribuidas bajo Apache 2.0. Por ejemplo, Mistral's Ministral 3 3B incluye términos Apache 2.0 y ofrece una ventana de contexto de 256K.
La apuesta de Hasani es que el desempeño en despliegue generará suficiente valor para sostener ese límite de licencias. Si LFM2.5-2.6B puede operar herramientas de forma fiable en CPUs de bajo costo, los agentes locales se vuelven viables en vehículos, lugares de trabajo regulados y dispositivos de consumo donde una conexión permanente a la nube es cara, indeseable o no está disponible. El lanzamiento proporciona a los desarrolladores los pesos y las herramientas para probar esa afirmación. La prueba más difícil vendrá de agentes que continúen completando trabajo real después de que termine la demostración.