LFM 2.5: Arquitectura, Benchmarks y Por Qué Importa para la IA Edge
13 August 2026 · Actualizado 14 August 2026

Gabriel Caetano
LFM 2.5: Arquitectura, Benchmarks y Por Qué Importa para la IA Edge
LFM 2.5 es la nueva familia de modelos edge de Liquid AI, creada para ejecutar IA rápida, privada y local. Funciona en celulares, laptops y Raspberry Pi, con gran desempeño en razonamiento, herramientas y capacidades multimodales.

Todo sobre el nuevo LFM 2.5: arquitectura, benchmarks y por qué importa para la IA en el edge
Correr una IA capaz sin pagar una cuenta en la nube ya no es una fantasía. LFM 2.5 es la nueva familia de modelos de fundación on-device de Liquid AI, y su agente insignia, LFM2.5-2.6B, cabe en menos de 2.5 GB de memoria, corre a unos 30 tokens por segundo en hardware tipo celular, y supera o iguala a modelos varias veces más grandes en ciertos benchmarks. Eso hace que la IA privada y sin conexión sea realmente práctica. Ten en cuenta que las cifras destacadas son benchmarks propios de Liquid AI, así que tómalas como afirmaciones hasta que pruebas independientes las confirmen.
Esta guía explica qué es LFM 2.5, cómo funciona su arquitectura, cómo se comparan sus variantes con Gemma, Qwen y DeepSeek, y cómo implementarlo. Si además usas suscripciones de IA en la nube como Claude, ChatGPT o Gemini para tareas más pesadas, hay una forma más inteligente de pagar por ellas también, y la veremos más adelante.
¿Construyes agentes localmente pero sigues pagando IA en la nube por otro lado? Bleap te cobra 0% de comisión cambiaria en tus suscripciones en USD y te da un cashback plano del 20% en las renovaciones de Claude, ChatGPT y Gemini, sin tener una suscripción propia. (El cashback del 20% aplica solo a esas tres herramientas.) Consigue la tarjeta Bleap →
1. ¿Qué es LFM 2.5? Descripción general y arquitectura
LFM 2.5 es la generación más reciente de los Liquid Foundation Models, desarrollados por Liquid AI, una empresa fundada por exinvestigadores del MIT. Esta familia de modelos tiene un objetivo claro: ofrecer inteligencia potente que funcione directamente en el dispositivo que tienes enfrente, no en un centro de datos.
La innovación central está en su arquitectura híbrida. LFM2.5-2.6B es un modelo de 2.69 mil millones de parámetros con 30 capas (22 bloques de convolución corta con doble compuerta y 8 capas GQA), un vocabulario de 128K y una ventana de contexto de 131,072 tokens. Al reemplazar la mayoría de las capas de atención por convoluciones cortas, se reduce el uso de memoria y se acelera la inferencia incluso en CPUs comunes.
Cómo funciona el diseño de Mezcla de Expertos
El modelo insignia en eficiencia añade un diseño de Mezcla de Expertos (MoE, por sus siglas en inglés) sobre esa arquitectura base. LFM2.5-8B-A1B utiliza un diseño MoE disperso que activa 1.5 mil millones de los 8.3 mil millones de parámetros totales en cada pasada, lo que mantiene bajo el costo de cómputo por cada token generado. Cada capa MoE cuenta con 32 expertos y selecciona los mejores 4 (top-k=4) por token, mediante un enrutador sigmoide normalizado y sesgos de enrutamiento adaptativos para balancear la carga. El resultado es una calidad cercana a la de un modelo de clase 4B, pero con un costo de decodificación similar al de uno de clase 1.5B, algo que los modelos transformer tradicionales simplemente no logran igualar en hardware con recursos limitados.
2. Variantes y tamaños del modelo LFM 2.5
LFM 2.5 no es un solo modelo, sino toda una gama de tamaños y especializaciones.
LFM2.5-230M
El checkpoint más pequeño. Liquid AI muestra que LFM2.5-230M obtiene 43.26 puntos en el benchmark de uso de herramientas BFCLv3, superando a Granite 4.0-350M de IBM (39.58) y dejando atrás a modelos más grandes de 1,000 millones de parámetros como Gemma 3 1B IT de Google (16.61). Está diseñado para llamadas a herramientas estructuradas y extracción de datos.
Familia LFM2.5-1.2B
Este es un lanzamiento integral que incluye modelos Base, Instruct, en japonés, de visión-lenguaje y de audio-lenguaje. Liquid AI amplió el preentrenamiento de 10 billones a 28 billones de tokens y escaló el post-entrenamiento con aprendizaje por refuerzo.
LFM2.5-2.6B
El agente de propósito general listo para celulares. Planifica, invoca herramientas y ejecuta tareas de varios pasos en celulares, laptops, PCs y robots.
LFM2.5-8B-A1B (MoE)
El buque insignia en razonamiento. A diferencia de su predecesor, LFM2.5-8B-A1B es un modelo enfocado únicamente en razonamiento, que genera una cadena de pensamiento explícita antes de dar su respuesta final.
Variante | Parámetros totales | Parámetros activos | Uso principal | Mejor hardware |
|---|---|---|---|---|
LFM2.5-230M | 230M | 230M | Llamadas a herramientas, extracción | Celular, Raspberry Pi |
LFM2.5-1.2B | 1.2B | 1.2B | Multimodal, multilingüe | Celular, laptop |
LFM2.5-2.6B | 2.69B | 2.69B | Agentes en el dispositivo | Laptop, celular |
LFM2.5-8B-A1B | 8.3B | 1.5B | Razonamiento, ciclos agénticos | GPU única de 24GB o CPU |
3. Capacidades de IA en el dispositivo y en el borde (Edge AI)
Todo el chiste de LFM 2.5 es funcionar sin depender de la nube ni de una GPU.
Ejecutando LFM 2.5 en Raspberry Pi y hardware móvil
Los números son la mejor prueba de esto. LFM2.5-230M corre a 213 tokens por segundo en un Galaxy S25 Ultra y a 42 tokens por segundo en una Pi 5. Para el agente más grande, Liquid AI midió 220 tokens por segundo de decodificación en un Apple M5 Max, 113 tokens por segundo en un AMD Ryzen AI Max+ 395, y alrededor de 30 tokens por segundo en un teléfono, todo esto usando menos de 2.5 GB de memoria.
Ventajas de privacidad e IA sin conexión
Como la inferencia se queda en el dispositivo, los datos nunca salen de ahí y el costo marginal de cada ejecución es prácticamente cero. Esto es clave para cargas de trabajo en salud, legal y finanzas, para entornos aislados (air-gapped), y para cualquier caso donde la factura de una API en la nube se dispararía a gran escala.
4. Benchmarks y resultados de rendimiento de LFM 2.5
Liquid AI compara su modelo contra las variantes de Gemma 4 y Qwen 3.5 usando su propia suite de evaluación.
Benchmarks de texto y razonamiento
Para el modelo de razonamiento, las mejoras respecto a su predecesor son enormes. LFM2.5-8B-A1B mejora en todos los aspectos: la tasa de no alucinación de AA-Omniscience saltó de 7.46 a 63.47, y IFEval subió de 79.44 a 91.84.
Benchmarks de matemáticas y tareas agénticas
MATH500 subió de 74.80 a 88.76 y Tau² Telecom pasó de 13.60 a 88.07. En el caso del agente más pequeño, LFM2.5-2.6B lidera en todos los benchmarks de seguimiento de instrucciones y en casi todos los de uso de herramientas, quedando solo por detrás de Qwen3.5-9B en BFCLv4, y supera a ambos modelos de Gemma en todas las tareas agénticas.
Benchmarks de visión y audio
Los checkpoints multimodales también cumplen. LFM2.5-VL-1.6B muestra un rendimiento más sólido en el seguimiento de instrucciones, tanto en benchmarks de visión como de texto, lo que lo convierte en una buena opción para aplicaciones multimodales en el edge.
Benchmarks de velocidad de inferencia
La velocidad es lo que más destaca. LFM2.5-2.6B es el modelo más rápido en su categoría de tamaño, alcanzando casi 15 mil tokens de salida por segundo con alta concurrencia, es decir, aproximadamente 1.3 mil millones de tokens al día en un solo H100.
¿Estás prototipando agentes de forma local, pero rentas modelos en la nube para las partes complicadas? Paga esas suscripciones en dólares con Bleap sin comisiones por tipo de cambio, más un cashback fijo del 20% en Claude, ChatGPT y Gemini. Tarjeta Mastercard autocustodiada, sin cuota mensual. Consigue la tarjeta Bleap →
5. LFM 2.5 vs. la competencia: comparaciones cara a cara
LFM 2.5 vs. DeepSeek-V4-Flash
DeepSeek-V4-Flash es un modelo de agente sólido, orientado a la nube. La ventaja de LFM 2.5 está en su capacidad de despliegue: funciona en un celular o en una Raspberry Pi sin necesidad de GPU, mientras que un modelo tipo Flash requiere hardware de servidor. Si tu carga de trabajo vive en el edge, LFM 2.5 es la opción clara.
LFM 2.5 vs. Google Gemma
Liquid AI hace comparaciones directas contra las variantes de Gemma 4. Evaluado frente a gemma-4-E2B-it (5.1B) y gemma-4-E4B-it (8B), entre otros, LFM2.5-2.6B lidera todos los benchmarks de seguimiento de instrucciones y todos los de uso de herramientas excepto BFCLv4. Gemma mantiene ventaja en programación.
LFM 2.5 vs. Alibaba Qwen
Qwen 3.5 es el rival más cercano en capacidad. En tareas agénticas, LFM2.5-2.6B compite muy de cerca con los modelos Qwen, va a la cabeza en AA-Omniscience-Public, y solo queda atrás de Qwen3.5-9B en matemáticas; la programación es el único terreno donde los modelos más grandes mantienen la ventaja. Es en la eficiencia de parámetros activos donde LFM 2.5 se pone por delante en costo por token.
La conclusión: LFM 2.5 ofrece una precisión competitiva con un cómputo muchísimo menor, ocupando un nicho al que los modelos más grandes no pueden llegar.
6. Filosofía de diseño de IA agéntica
LFM 2.5 está construido primero para agentes y segundo para chat.
Uso de herramientas y flujos de trabajo agénticos
Los modelos soportan llamadas a funciones nativas y planificación en múltiples pasos. El diseño MoE es clave aquí: menos parámetros activos significan iteraciones más rápidas en los ciclos agénticos. El costo cero por token permite paralelismo continuo de agentes en segundo plano, un patrón que las APIs de nube con tarifas medidas impiden estructuralmente, así que los agentes se pueden paralelizar masivamente en hardware local sin costo marginal.
Casos de uso agénticos prácticos
Entre las implementaciones prácticas están los asistentes en el dispositivo, la clasificación de documentos sin conexión con entradas de hasta 128K, la extracción de datos de formularios y facturas, el análisis de comandos para robótica, y agentes en segundo plano que corren de forma continua sin costo por token. Aun así, hay que ser honestos con los límites: Liquid AI señala explícitamente que no recomienda este modelo para programación agéntica ni para tareas que exigen mucho conocimiento.
7. Capacidades multimodales: visión y audio
LFM 2.5 es una familia multimodal, no un modelo solo de texto.
Modelo de visión y lenguaje LFM 2.5
El checkpoint de visión maneja imágenes, gráficas y documentos junto con texto, y la variante VL de 1.6B está ajustada para seguir instrucciones con gran precisión en dispositivos edge, lo cual es ideal para flujos de trabajo móviles con documentos e imágenes.
Modelo de audio y lenguaje LFM 2.5
El modelo de audio y lenguaje se lanzó como parte de la versión de 1.2B, cubriendo comprensión de voz y respuesta a preguntas basadas en audio. Entre sus posibles aplicaciones están los asistentes de voz, los resúmenes de reuniones y las herramientas de accesibilidad, todo funcionando sin conexión para proteger la privacidad.
8. Qué cambió de LFM 2.0 a LFM 2.5
El salto es considerable. Liquid AI duplicó el vocabulario a 128K extendiendo el tokenizador en lugar de reentrenarlo desde cero, para dar mejor soporte a escrituras no latinas. El entrenamiento escaló de forma importante, con el modelo MoE de 8B entrenado con 38T tokens más RL a gran escala. LFM 2.5 también agregó una ventana de contexto de 128K, capacidades de razonamiento y modelos multimodales de Visión y Audio que no existían en la versión 2.0.
9. Licencia y disponibilidad comercial
Qué permite la licencia
Los modelos se distribuyen bajo la licencia propia de Liquid. Tanto el modelo base como la variante agentic post-entrenada están disponibles en Hugging Face bajo la LFM Open License v1.0, que permite el uso comercial. Sin embargo, el modelo se distribuye bajo una licencia propia de Liquid y no una licencia permisiva estándar, así que cualquiera con planes comerciales debería leer los términos antes de construir sobre él.
Dónde acceder a LFM 2.5
Puedes descargar los pesos y las model cards desde Hugging Face, o acceder a los modelos a través de OpenRouter y la propia API de Liquid AI para prototipado rápido.
10. Cómo empezar y desplegar LFM 2.5
Inicio rápido vía API
Crea una cuenta en OpenRouter o Liquid AI, obtén una API key, elige tu variante mediante el endpoint y envía una solicitud de prueba. Este es el camino más rápido para tener un prototipo funcionando.
Configuración local vía Hugging Face
Instala tu stack de inferencia, descarga los pesos de la variante que elegiste desde la model card en Hugging Face y ejecuta la inferencia de forma local. El soporte desde el día uno incluye llama.cpp, MLX, vLLM y SGLang, con pesos base y post-entrenados abiertos.
Despliegue en edge
Para Raspberry Pi y dispositivos móviles, usa formatos cuantizados como GGUF con INT4/INT8. Para el modelo insignia MoE en GPU, calcula el tamaño de la GPU considerando los ~8B de pesos completos (≈17 GB en BF16 más la caché KV), aunque solo ~1B esté activo por token, apuntando a una GPU con al menos 24 GB de VRAM.
11. Valor en el mundo real: aplicaciones de negocio y personales
Para desarrolladores independientes y entusiastas
Crea apps de IA offline en hardware de consumo sin costos recurrentes de API, experimentando libremente a través de Hugging Face.
Para empresas
El despliegue privado y on-premises elimina el riesgo de compartir datos, reduce los costos de inferencia frente a las APIs tipo GPT-4 a gran escala, y permite un ajuste fino vertical con datos propios.
Para industrias de edge computing e IoT
El control de calidad en manufactura con el modelo de visión, agentes para hogares inteligentes y robótica con el 8B-A1B, y soporte de diagnóstico en regiones con conectividad limitada están todos al alcance.
¿Estás lanzando un producto de IA pero sigues gastando de más en suscripciones de modelos en la nube? Bleap te da 0% de comisiones cambiarias en cargos en USD y un cashback fijo del 20% en Claude, ChatGPT y Gemini, con una Mastercard autocustodiada y sin suscripción mensual. Consigue la tarjeta Bleap →
Preguntas frecuentes sobre LFM 2.5
¿Qué hardware necesita LFM 2.5 y de verdad puede correr en una Raspberry Pi?
Sí. Las variantes más chicas corren en hardware limitado gracias a la cuantización. LFM2.5-230M alcanza 42 tokens por segundo en una Pi 5, mientras que el agente de 2.6B corre con menos de 2.5 GB de memoria, incluyendo alrededor de 30 tokens por segundo en un teléfono.
¿Cómo se compara LFM 2.5 con DeepSeek y Qwen con la misma cantidad de parámetros?
Frente a Qwen, LFM2.5-2.6B va a la cabeza en todos los benchmarks de seguimiento de instrucciones y en casi todos los de uso de herramientas, quedando solo detrás de Qwen3.5-9B en BFCLv4. Su eficiencia en parámetros activos se traduce en un consumo de cómputo por token mucho menor que el de sus rivales densos o modelos de nube más grandes como DeepSeek-V4-Flash.
¿LFM 2.5 se puede usar comercialmente sin costo?
En su mayoría, sí. Los pesos están disponibles en Hugging Face bajo la LFM Open License v1.0, que permite el uso comercial, pero conviene leer los términos de la licencia antes de construir un producto comercial con ella.
¿Dónde puedo descargar o acceder a los modelos de LFM 2.5?
En Hugging Face para los pesos, y a través de OpenRouter o la API de Liquid AI para acceso alojado.
¿LFM 2.5 soporta visión y audio, o solo texto?
Es multimodal. El lanzamiento incluye modelos Base, Instruct, Japonés, Visión-Lenguaje y Audio-Lenguaje.
¿Qué tan rápida es la inferencia de LFM 2.5 comparada con modelos de tamaño similar?
Muy rápida para su categoría. LFM2.5-2.6B alcanza casi 15K tokens de salida por segundo con alta concurrencia, gracias a su arquitectura de convolución corta y al enrutamiento disperso de MoE.
Conclusión: ¿es LFM 2.5 el modelo de IA en el borde a seguir?
LFM 2.5 se ganó la atención: benchmarks competitivos, soporte multimodal nativo y una arquitectura lo bastante potente para agentes empresariales, pero lo bastante ligera para correr en una Raspberry Pi. Los desarrolladores que están prototipando agentes, las empresas evaluando IA privada y los ingenieros de hardware de borde deberían darle una mirada seria ahora mismo, ya sea en Hugging Face o vía la API.
Y sin importar qué herramientas de IA uses junto con este modelo, paga de forma inteligente. Con Bleap te ahorras las comisiones por conversión de divisas en tus suscripciones en dólares, y con Claude, ChatGPT y Gemini obtienes 20% de cashback en cada renovación, todo con una Mastercard autocustodiada y sin ninguna suscripción propia.
Una forma más inteligente de gastar, enviar, ganar y operar









