Blogs

LFM 2.5: Arquitectura, Benchmarks y Por Qué Importa para la IA Edge

13 August 2026  ·  Actualizado 14 August 2026

Gabriel Caetano

Gabriel Caetano

LFM 2.5: Arquitectura, Benchmarks y Por Qué Importa para la IA Edge

LFM 2.5 es la nueva familia de modelos edge de Liquid AI, diseñada para ejecutar IA rápida, privada y local. Funciona en móviles, portátiles y Raspberry Pi con un gran rendimiento en razonamiento, uso de herramientas y multimodalidad.

lfm-2-5-architecture-benchmarks-edge-ai

Todo sobre el nuevo LFM 2.5: arquitectura, benchmarks y por qué importa para la IA en el edge

Ejecutar IA capaz sin una factura en la nube ya no es una fantasía. LFM 2.5 es la nueva familia de modelos fundacionales on-device de Liquid AI, y su agente insignia, LFM2.5-2.6B, cabe en menos de 2,5 GB de memoria, funciona a unos 30 tokens por segundo en hardware de gama móvil, y supera o iguala a modelos varias veces más grandes en determinados benchmarks. Eso convierte la IA privada y offline en algo genuinamente práctico. Ten en cuenta que las cifras destacadas son benchmarks propios de Liquid AI, así que trátalas como afirmaciones del fabricante hasta que pruebas independientes las confirmen.

Esta guía explica qué es LFM 2.5, cómo funciona su arquitectura, cómo se comparan las variantes con Gemma, Qwen y DeepSeek, y cómo implementarlo. Si además dependes de suscripciones de IA en la nube como Claude, ChatGPT o Gemini para trabajos más pesados, hay una forma más inteligente de pagarlas también, que veremos más adelante.

¿Construyes agentes en local pero sigues pagando IA en la nube por otro lado? Bleap no cobra comisiones de cambio de divisa en tus suscripciones en USD y te da un 20% de cashback fijo en las renovaciones de Claude, ChatGPT y Gemini, sin suscripción propia. (El 20% de cashback se aplica solo a esas tres herramientas.) Consigue la tarjeta Bleap →

1. ¿Qué es LFM 2.5? Visión general y arquitectura

LFM 2.5 es la última generación de Liquid Foundation Models, desarrollada por Liquid AI, una empresa fundada por antiguos investigadores del MIT. La familia persigue un único objetivo: una inteligencia potente que funcione en el dispositivo que tienes delante, no en un centro de datos.

La innovación clave es una arquitectura híbrida. LFM2.5-2.6B es un modelo de 2,69 mil millones de parámetros con 30 capas (22 bloques de convolución corta con doble puerta y 8 capas GQA), un vocabulario de 128K y una ventana de contexto de 131.072 tokens. Al sustituir la mayoría de las capas de atención por convoluciones cortas, se reduce el uso de memoria y se acelera la inferencia en CPUs convencionales.

Cómo funciona el diseño de Mixture of Experts

El modelo insignia en cuanto a eficiencia añade un diseño de Mixture of Experts (MoE) sobre esa arquitectura base. LFM2.5-8B-A1B utiliza un diseño MoE disperso que activa 1.500 millones de los 8.300 millones de parámetros totales en cada pasada hacia delante, lo que mantiene bajo el coste de cómputo de cada token generado. Cada capa MoE cuenta con 32 expertos y selecciona los top-k=4 expertos por token mediante un router sigmoide normalizado y sesgos de enrutamiento adaptativos para equilibrar la carga. El resultado es una calidad equivalente aproximadamente a la de un modelo de clase 4B, pero con un coste de decodificación cercano al de un modelo de clase 1,5B, algo que los modelos transformer convencionales no pueden igualar en hardware limitado.

2. Variantes y tamaños del modelo LFM 2.5

LFM 2.5 no es un único modelo, sino un abanico de tamaños y especializaciones.

LFM2.5-230M

El checkpoint más pequeño. Liquid AI muestra que LFM2.5-230M obtiene 43,26 puntos en el benchmark de uso de herramientas BFCLv3, superando ampliamente al Granite 4.0-350M de IBM (39,58) y dejando atrás a modelos más grandes de 1.000 millones de parámetros como Gemma 3 1B IT de Google (16,61). Está diseñado para llamadas a herramientas estructuradas y extracción de datos.

Familia LFM2.5-1.2B

Se trata de un lanzamiento muy completo que incluye modelos Base, Instruct, japonés, visión-lenguaje y audio-lenguaje. Liquid AI ha ampliado el preentrenamiento de 10 a 28 billones de tokens y ha escalado el post-entrenamiento con aprendizaje por refuerzo.

LFM2.5-2.6B

El agente de uso general listo para móviles. Planifica, invoca herramientas y resuelve tareas de varios pasos en teléfonos, portátiles, PC y robots.

LFM2.5-8B-A1B (MoE)

El buque insignia en razonamiento. A diferencia de su predecesor, LFM2.5-8B-A1B es un modelo centrado exclusivamente en el razonamiento, que genera una cadena de pensamiento explícita antes de dar su respuesta final.

Variante

Parámetros totales

Parámetros activos

Uso principal

Mejor hardware

LFM2.5-230M

230M

230M

Llamadas a herramientas, extracción

Móvil, Raspberry Pi

LFM2.5-1.2B

1,2B

1,2B

Multimodal, multilingüe

Móvil, portátil

LFM2.5-2.6B

2,69B

2,69B

Agentes en el dispositivo

Portátil, móvil

LFM2.5-8B-A1B

8,3B

1,5B

Razonamiento, bucles agénticos

Una sola GPU de 24GB o CPU

3. Capacidades de IA en el dispositivo y en el edge

Todo el sentido de LFM 2.5 es funcionar sin la nube ni una GPU.

Ejecutar LFM 2.5 en Raspberry Pi y hardware móvil

Las cifras son la señal práctica. LFM2.5-230M funciona a 213 tokens por segundo en un Galaxy S25 Ultra y a 42 tokens por segundo en una Pi 5. Para el agente más grande, Liquid AI midió 220 tokens por segundo de decodificación en un Apple M5 Max, 113 tokens por segundo en un AMD Ryzen AI Max+ 395 y unos 30 tokens por segundo en un móvil, todo ello por debajo de los 2,5 GB de memoria.

Ventajas de la privacidad y la IA sin conexión

Como la inferencia se mantiene local, los datos nunca salen del dispositivo y el coste marginal de cada ejecución es prácticamente nulo. Esto es clave para cargas de trabajo en sanidad, derecho y finanzas, entornos aislados sin conexión a redes externas, y cualquier situación en la que la factura de una API en la nube se dispararía a gran escala.

4. Benchmarks y resultados de rendimiento de LFM 2.5

Liquid AI compara sus modelos con las variantes de Gemma 4 y Qwen 3.5 usando su propia suite de evaluación.

Benchmarks de texto y razonamiento

Para el modelo de razonamiento, las mejoras respecto a su predecesor son notables. LFM2.5-8B-A1B mejora en todos los aspectos: la tasa de no alucinación de AA-Omniscience pasó de 7,46 a 63,47 e IFEval subió de 79,44 a 91,84.

Benchmarks de matemáticas y tareas agénticas

MATH500 subió de 74,80 a 88,76 y Tau² Telecom pasó de 13,60 a 88,07. En cuanto al agente más pequeño, LFM2.5-2.6B lidera en todos los benchmarks de seguimiento de instrucciones y en casi todos los de uso de herramientas, quedando solo por detrás de Qwen3.5-9B en BFCLv4, y supera a ambos modelos de Gemma en todas las tareas agénticas.

Benchmarks de visión y audio

Los checkpoints multimodales también dan la talla. LFM2.5-VL-1.6B muestra un rendimiento superior en el seguimiento de instrucciones tanto en benchmarks de visión como de texto, lo que lo convierte en una buena opción para aplicaciones multimodales en el dispositivo (on-edge).

Benchmarks de velocidad de inferencia

La velocidad es lo más destacado. LFM2.5-2.6B es el modelo más rápido de su categoría de tamaño, alcanzando casi 15.000 tokens de salida por segundo con alta concurrencia, es decir, aproximadamente 1.300 millones de tokens al día en una sola H100.

¿Prototipas agentes en local, pero alquilas modelos en la nube para las partes complicadas? Paga esas suscripciones en USD con Bleap sin comisiones de cambio de divisa, además de un 20% de cashback plano en Claude, ChatGPT y Gemini. Mastercard autocustodiada, sin cuota mensual. Consigue la tarjeta Bleap →

5. LFM 2.5 frente a la competencia: comparativas directas

LFM 2.5 vs. DeepSeek-V4-Flash

DeepSeek-V4-Flash es un modelo de agente potente y orientado a la nube. La ventaja de LFM 2.5 es su capacidad de despliegue: funciona en un móvil o una Raspberry Pi sin necesidad de GPU, mientras que un modelo de clase Flash requiere hardware de servidor. Si tu carga de trabajo vive en el edge, LFM 2.5 es la opción clara.

LFM 2.5 vs. Google Gemma

Liquid AI se compara directamente con las variantes de Gemma 4. Evaluado frente a gemma-4-E2B-it (5.1B) y gemma-4-E4B-it (8B), entre otros, LFM2.5-2.6B lidera todos los benchmarks de seguimiento de instrucciones y todos los de uso de herramientas excepto BFCLv4. Gemma mantiene la ventaja en programación.

LFM 2.5 vs. Alibaba Qwen

Qwen 3.5 es el rival más cercano en capacidad. En tareas agénticas, LFM2.5-2.6B compite de cerca con los modelos Qwen, lidera en AA-Omniscience-Public, solo queda por detrás de Qwen3.5-9B en matemáticas, y la programación es la única área donde los modelos más grandes mantienen ventaja. La eficiencia en parámetros activos es donde LFM 2.5 se adelanta en coste por token.

La conclusión: LFM 2.5 ofrece una precisión competitiva con un coste computacional drásticamente menor, ocupando un nicho al que los modelos más grandes no pueden llegar.

6. Filosofía de diseño de la IA agéntica

LFM 2.5 está pensado para agentes en primer lugar y para el chat en segundo.

Uso de herramientas y flujos de trabajo agénticos

Los modelos admiten llamadas a funciones nativas y planificación en varios pasos. Aquí el diseño MoE es clave: menos parámetros activos significan una iteración más rápida en los bucles agénticos. El coste cero por token permite el paralelismo continuo de agentes en segundo plano, un patrón que las API de nube tarificadas por uso impiden estructuralmente, de modo que los agentes pueden paralelizarse masivamente en hardware local sin coste marginal alguno.

Casos de uso agénticos prácticos

Entre los desarrollos prácticos se incluyen asistentes en el propio dispositivo, clasificación de documentos sin conexión con entradas de hasta 128K, extracción de datos de formularios y facturas, interpretación de comandos de robótica, y agentes en segundo plano que funcionan de forma continua sin coste por token. Aun así, hay que ser honestos sobre su alcance: Liquid AI desaconseja explícitamente este modelo para programación agéntica o tareas que requieran mucho conocimiento.

7. Capacidades multimodales: visión y audio

LFM 2.5 es una familia multimodal, no un modelo solo de texto.

Modelo de visión y lenguaje LFM 2.5

El checkpoint de visión gestiona imágenes, gráficos y documentos junto con texto, y la variante VL de 1.6B está ajustada para ofrecer un buen seguimiento de instrucciones en dispositivos periféricos, lo que la hace idónea para flujos de trabajo móviles con documentos e imágenes.

Modelo de audio y lenguaje LFM 2.5

El modelo de audio y lenguaje se lanzó como parte de la versión de 1.2B, y cubre la comprensión del habla y la respuesta a preguntas sobre audio. Entre sus posibles aplicaciones se incluyen asistentes de voz, resúmenes de reuniones y herramientas de accesibilidad, todas ellas funcionando sin conexión para proteger la privacidad.

8. Qué ha cambiado de LFM 2.0 a LFM 2.5

El salto es considerable. Liquid AI ha duplicado el vocabulario hasta 128K ampliando el tokenizador sobre la marcha en lugar de reentrenarlo desde cero, con el objetivo de dar mejor soporte a alfabetos no latinos. El entrenamiento se ha escalado de forma notable, con el modelo 8B MoE entrenado con 38 billones de tokens además de RL a gran escala. LFM 2.5 también ha incorporado una ventana de contexto de 128K, capacidades de razonamiento y modelos multimodales de visión y audio que no existían en la versión 2.0.

9. Licencia y disponibilidad comercial

Qué permite la licencia

Los modelos se distribuyen bajo la licencia propia de Liquid. Tanto el modelo base como la variante agéntica post-entrenada están disponibles en Hugging Face bajo la LFM Open License v1.0, que permite el uso comercial. Dicho esto, el modelo se distribuye bajo una licencia propia de Liquid y no una licencia permisiva estándar, así que cualquiera con planes comerciales debería leer los términos antes de construir sobre él.

Dónde acceder a LFM 2.5

Puedes descargar los pesos y las fichas de modelo desde Hugging Face, o acceder a los modelos a través de OpenRouter y de la propia API de Liquid AI para prototipado rápido.

10. Cómo empezar y desplegar LFM 2.5

Inicio rápido vía API

Crea una cuenta en OpenRouter o Liquid AI, obtén una clave de API, selecciona tu variante a través del endpoint y envía una solicitud de prueba. Este es el camino más rápido para tener un prototipo funcionando.

Configuración local vía Hugging Face

Instala tu stack de inferencia, descarga los pesos de la variante elegida desde la ficha del modelo en Hugging Face y ejecuta la inferencia en local. El soporte desde el primer día abarca llama.cpp, MLX, vLLM y SGLang, con pesos abiertos tanto del modelo base como del post-entrenado.

Despliegue en el edge

Para Raspberry Pi y móviles, utiliza formatos cuantizados como GGUF con INT4/INT8. Para el modelo insignia MoE en GPU, dimensiona la GPU para el total de ~8B de pesos (≈17 GB en BF16 más la caché KV), aunque solo ~1B esté activo por token, apuntando a una GPU con al menos 24 GB de VRAM.

11. Valor en el mundo real: aplicaciones empresariales y personales

Para desarrolladores individuales y aficionados

Crea aplicaciones de IA offline en hardware de consumo sin coste recurrente de API, experimentando libremente a través de Hugging Face.

Para empresas

El despliegue privado, en las propias instalaciones, elimina el riesgo de compartir datos, reduce los costes de inferencia frente a las API de la clase GPT-4 a gran escala, y permite el ajuste fino vertical con datos propios.

Para el sector edge e IoT

El control de calidad en fabricación con el modelo de visión, los agentes de hogar inteligente y robótica con el 8B-A1B, y el soporte de diagnóstico en regiones con conectividad limitada están al alcance de la mano.

¿Estás lanzando un producto de IA pero sigues quemando dinero en suscripciones a modelos en la nube? Bleap te ofrece 0% de comisiones por cambio de divisa en la facturación en USD y un cashback plano del 20% en Claude, ChatGPT y Gemini, con una Mastercard autocustodiada y sin suscripción mensual. Consigue la tarjeta Bleap →

Preguntas frecuentes sobre LFM 2.5

¿Qué hardware necesita LFM 2.5 y puede funcionar realmente en una Raspberry Pi?

Sí. Las variantes más pequeñas funcionan en hardware limitado gracias a la cuantización. LFM2.5-230M alcanza 42 tokens por segundo en una Pi 5, mientras que el agente de 2,6B funciona con menos de 2,5 GB de memoria, incluyendo unos 30 tokens por segundo en un teléfono móvil.

¿Cómo se compara LFM 2.5 con DeepSeek y Qwen con el mismo número de parámetros?

Frente a Qwen, LFM2.5-2.6B se sitúa a la cabeza en todos los benchmarks de seguimiento de instrucciones y en casi todos los de uso de herramientas, quedando solo por detrás de Qwen3.5-9B en BFCLv4. Su eficiencia en parámetros activos supone un coste computacional por token mucho menor que el de sus rivales densos o de modelos en la nube más grandes como DeepSeek-V4-Flash.

¿Se puede usar LFM 2.5 gratis con fines comerciales?

En gran medida, sí. Los pesos están disponibles en Hugging Face bajo la licencia LFM Open License v1.0, que permite el uso comercial, pero conviene leer los términos de la licencia antes de construir un producto comercial con ella.

¿Dónde puedo descargar o acceder a los modelos LFM 2.5?

En Hugging Face para los pesos, y a través de OpenRouter o la API de Liquid AI para acceso alojado.

¿LFM 2.5 admite visión y audio, o solo texto?

Es multimodal. La versión incluye modelos Base, Instruct, japonés, de visión y lenguaje, y de audio y lenguaje.

¿Qué tan rápida es la inferencia de LFM 2.5 comparada con modelos de tamaño similar?

Muy rápida para su categoría. LFM2.5-2.6B alcanza casi 15.000 tokens de salida por segundo con alta concurrencia, gracias a su arquitectura de convolución corta y al enrutamiento disperso de MoE.

Conclusión: ¿es LFM 2.5 el modelo de IA edge a seguir?

LFM 2.5 se gana la atención que recibe: benchmarks competitivos, soporte multimodal nativo y una arquitectura lo bastante potente para agentes empresariales, pero lo bastante ligera para una Raspberry Pi. Los desarrolladores que prototipan agentes, las empresas que evalúan IA privada y los ingenieros de hardware edge deberían echarle un vistazo en serio ya, empezando por Hugging Face o la API.

Y sea cual sea la herramienta de IA que uses junto a ella, paga de forma inteligente. Con Bleap te olvidas de las comisiones de cambio de divisa en las suscripciones en USD, y en Claude, ChatGPT y Gemini recibes un 20% de cashback en cada renovación, con una Mastercard autocustodiada y sin suscripción propia.

Una forma más inteligente de gastar, enviar, ganar y operar

Imagen de la sección Puntos Clave

Artículos relacionados