LFM 2.5 : Architecture, Benchmarks et Pourquoi il Compte pour l’IA Edge
13 August 2026 · Mis à jour 14 August 2026

Gabriel Caetano
LFM 2.5 : Architecture, Benchmarks et Pourquoi il Compte pour l’IA Edge
LFM 2.5 est la nouvelle famille de modèles edge de Liquid AI, conçue pour une IA rapide, privée et exécutée localement. Elle fonctionne sur smartphones, ordinateurs portables et Raspberry Pi avec de solides performances en raisonnement et multimodalité.

Tout savoir sur le nouveau LFM 2.5 : architecture, benchmarks, et pourquoi ça compte pour l'IA embarquée
Faire tourner une IA performante sans facture cloud n'est plus une utopie. LFM 2.5 est la toute nouvelle famille de modèles fondation embarqués de Liquid AI, et son agent phare, LFM2.5-2.6B, tient dans moins de 2,5 Go de mémoire, tourne à environ 30 tokens par seconde sur du matériel équivalent à un smartphone, et bat ou égale des modèles plusieurs fois plus gros sur certains benchmarks. Ça rend l'IA privée et hors ligne réellement concrète. À noter tout de même : les chiffres phares viennent des benchmarks internes de Liquid AI, donc à prendre avec des pincettes tant que des tests indépendants ne les confirment pas.
Ce guide explique ce qu'est LFM 2.5, comment fonctionne son architecture, comment les différentes variantes se comparent à Gemma, Qwen et DeepSeek, et comment le déployer. Si vous jonglez aussi avec des abonnements IA cloud comme Claude, ChatGPT ou Gemini pour les tâches plus lourdes, il existe une façon plus maligne de les payer, qu'on abordera au passage.
Vous créez des agents en local mais vous payez quand même pour de l'IA cloud à côté ? Bleap ne prend aucun frais de change sur vos abonnements en dollars et offre 20% de cashback à plat sur les renouvellements Claude, ChatGPT et Gemini, sans abonnement de son côté. (Le cashback de 20% ne s'applique qu'à ces trois outils.) Obtenir la carte Bleap →
1. Qu'est-ce que LFM 2.5 ? Présentation et architecture
LFM 2.5 est la dernière génération des Liquid Foundation Models, développée par Liquid AI, une entreprise fondée par d'anciens chercheurs en informatique du MIT. Cette famille de modèles vise un objectif précis : une intelligence artificielle puissante qui fonctionne directement sur votre appareil, et non dans un data center.
L'innovation clé réside dans une architecture hybride. LFM2.5-2.6B est un modèle de 2,69 milliards de paramètres comptant 30 couches (22 blocs de convolution courte à double porte et 8 couches GQA), un vocabulaire de 128K et une fenêtre de contexte de 131 072 tokens. En remplaçant la plupart des couches d'attention par des convolutions courtes, on réduit l'utilisation de la mémoire et on accélère l'inférence sur des CPU classiques.
Comment fonctionne le design Mixture of Experts
Le modèle phare en matière d'efficacité superpose un design Mixture of Experts (MoE) à cette architecture de base. LFM2.5-8B-A1B utilise un design MoE parcimonieux qui active 1,5 milliard de paramètres sur un total de 8,3 milliards à chaque passage, ce qui maintient un coût de calcul très bas pour chaque token généré. Chaque couche MoE compte 32 experts et sélectionne les 4 meilleurs (top-k=4) par token grâce à un routeur sigmoïde normalisé et des biais de routage adaptatifs pour l'équilibrage de charge. Le résultat : une qualité proche de la classe 4B pour un coût de décodage proche de la classe 1,5B, une performance que les modèles transformers classiques ne peuvent tout simplement pas égaler sur du matériel aux ressources limitées.
2. Variantes et tailles du modèle LFM 2.5
LFM 2.5 n'est pas un seul modèle, mais toute une gamme de tailles et de spécialisations.
LFM2.5-230M
Le plus petit checkpoint. Liquid AI montre que LFM2.5-230M obtient un score de 43,26 sur le benchmark d'utilisation d'outils BFCLv3, dépassant largement Granite 4.0-350M d'IBM (39,58) et surclassant même des modèles plus gros de 1 milliard de paramètres comme Gemma 3 1B IT de Google (16,61). Il est conçu pour les appels d'outils structurés et l'extraction de données.
Famille LFM2.5-1.2B
Il s'agit d'une release complète comprenant des modèles Base, Instruct, Japonais, Vision-Langage et Audio-Langage. Liquid AI a étendu le pré-entraînement de 10T à 28T tokens et a intensifié le post-entraînement avec de l'apprentissage par renforcement.
LFM2.5-2.6B
L'agent généraliste, prêt pour le mobile. Il planifie, appelle des outils et gère des tâches en plusieurs étapes sur téléphones, ordinateurs portables, PC et robots.
LFM2.5-8B-A1B (MoE)
Le fleuron du raisonnement. Contrairement à son prédécesseur, LFM2.5-8B-A1B est un modèle exclusivement dédié au raisonnement, qui produit une chaîne de pensée explicite avant de donner sa réponse finale.
Variante | Paramètres totaux | Paramètres actifs | Usage principal | Matériel recommandé |
|---|---|---|---|---|
LFM2.5-230M | 230M | 230M | Appels d'outils, extraction | Téléphone, Raspberry Pi |
LFM2.5-1.2B | 1,2B | 1,2B | Multimodal, multilingue | Téléphone, ordinateur portable |
LFM2.5-2.6B | 2,69B | 2,69B | Agents embarqués | Ordinateur portable, téléphone |
LFM2.5-8B-A1B | 8,3B | 1,5B | Raisonnement, boucles agentiques | GPU 24 Go unique ou CPU |
3. Capacités d'IA embarquée et en périphérie (edge)
Tout l'intérêt de LFM 2.5, c'est de fonctionner sans cloud ni GPU.
Faire tourner LFM 2.5 sur Raspberry Pi et sur mobile
Les chiffres parlent d'eux-mêmes. LFM2.5-230M tourne à 213 tokens par seconde sur un Galaxy S25 Ultra et 42 tokens par seconde sur un Pi 5. Pour l'agent plus imposant, Liquid AI a mesuré un décodage à 220 tokens par seconde sur un Apple M5 Max, 113 tokens par seconde sur un AMD Ryzen AI Max+ 395, et environ 30 tokens par seconde sur un smartphone, le tout avec moins de 2,5 Go de mémoire.
Les avantages de la confidentialité et de l'IA hors ligne
Comme l'inférence reste locale, les données ne quittent jamais l'appareil et le coût marginal de chaque exécution est quasi nul. C'est un vrai atout pour les usages en santé, dans le juridique et la finance, pour les environnements isolés du réseau (air-gapped), et partout où une facture d'API cloud exploserait à grande échelle.
4. Benchmarks et résultats de performance de LFM 2.5
Liquid AI compare ses modèles à Gemma 4 et aux variantes Qwen 3.5 en utilisant sa propre suite d'évaluation.
Benchmarks de texte et de raisonnement
Pour le modèle de raisonnement, les progrès par rapport à son prédécesseur sont considérables. LFM2.5-8B-A1B s'améliore sur tous les points : le taux de non-hallucination AA-Omniscience est passé de 7,46 à 63,47, et IFEval a grimpé de 79,44 à 91,84.
Benchmarks de mathématiques et de tâches agentiques
MATH500 est passé de 74,80 à 88,76, et Tau² Telecom de 13,60 à 88,07. Côté agent plus léger, LFM2.5-2.6B se hisse en tête sur tous les benchmarks de suivi d'instructions et sur presque tous les benchmarks d'utilisation d'outils, ne s'inclinant que face à Qwen3.5-9B sur BFCLv4, et surpasse les deux modèles Gemma sur l'ensemble des tâches agentiques.
Benchmarks vision et audio
Les versions multimodales tiennent également la route. LFM2.5-VL-1.6B affiche de meilleures performances en suivi d'instructions, aussi bien sur les benchmarks vision que texte, ce qui en fait un bon choix pour les applications multimodales en edge computing.
Benchmarks de vitesse d'inférence
La vitesse, c'est vraiment le point fort. LFM2.5-2.6B est le modèle le plus rapide de sa catégorie de taille, atteignant près de 15K tokens de sortie par seconde en forte concurrence, soit environ 1,3 milliard de tokens par jour sur un seul H100.
Vous prototypez vos agents en local, mais louez des modèles cloud pour les tâches les plus lourdes ? Réglez vos abonnements en dollars avec Bleap, sans frais de change, et profitez d'un cashback fixe de 20% sur Claude, ChatGPT et Gemini. Carte Mastercard auto-custodiale, sans frais mensuels. Obtenir la carte Bleap →
5. LFM 2.5 face à la concurrence : comparatifs directs
LFM 2.5 vs. DeepSeek-V4-Flash
DeepSeek-V4-Flash est un modèle agent solide, plutôt orienté cloud. L'atout de LFM 2.5, c'est sa facilité de déploiement : il tourne sur un smartphone ou un Raspberry Pi sans GPU, là où un modèle de la classe Flash nécessite du matériel serveur. Si votre charge de travail s'exécute en périphérie (edge), LFM 2.5 est clairement le bon choix.
LFM 2.5 vs. Google Gemma
Liquid AI se compare directement aux variantes de Gemma 4. Face à gemma-4-E2B-it (5,1 Md) et gemma-4-E4B-it (8 Md), entre autres, LFM2.5-2.6B arrive en tête sur tous les benchmarks de suivi d'instructions et tous les benchmarks d'utilisation d'outils, sauf BFCLv4. Gemma garde l'avantage en programmation.
LFM 2.5 vs. Alibaba Qwen
Qwen 3.5 est le rival le plus proche en termes de capacités. Sur les tâches agentiques, LFM2.5-2.6B se bat à armes égales avec les modèles Qwen, prend la tête sur AA-Omniscience-Public, ne s'incline qu'face à Qwen3.5-9B en mathématiques, et la programmation reste le seul domaine où les modèles plus imposants gardent l'avantage. C'est sur l'efficacité par paramètre actif que LFM 2.5 prend l'avantage en termes de coût par token.
Ce qu'il faut retenir : LFM 2.5 offre une précision compétitive avec une puissance de calcul largement réduite, occupant ainsi une niche que les modèles plus imposants ne peuvent pas atteindre.
6. La philosophie de conception de l'IA agentique
LFM 2.5 a été pensé pour les agents avant tout, le chat vient ensuite.
Utilisation d'outils et workflows agentiques
Les modèles prennent en charge l'appel de fonctions natif et la planification multi-étapes. La conception MoE joue un rôle clé ici : moins de paramètres actifs signifie une itération plus rapide dans les boucles agentiques. Le coût nul par token permet un parallélisme continu des agents en arrière-plan, un fonctionnement que les API cloud facturées à l'usage empêchent structurellement. Les agents peuvent ainsi être massivement parallélisés sur du matériel local sans coût marginal.
Cas d'usage agentiques concrets
Parmi les applications concrètes, on trouve les assistants embarqués, le tri de documents hors ligne sur des entrées de 128K, l'extraction de données de formulaires et de factures, l'analyse de commandes en robotique, et les agents en arrière-plan qui tournent en continu sans coût par token. Mais soyons honnêtes sur le périmètre : Liquid AI déconseille explicitement ce modèle pour le codage agentique ou les tâches nécessitant beaucoup de connaissances.
7. Capacités multimodales : vision et audio
LFM 2.5 est une famille multimodale, pas seulement un modèle de texte.
Le modèle vision-langage LFM 2.5
Le checkpoint vision traite les images, les graphiques et les documents en plus du texte, et la variante VL de 1,6 milliard de paramètres est optimisée pour bien suivre les instructions sur les appareils embarqués, ce qui convient parfaitement aux workflows mobiles de traitement de documents et d'images.
Le modèle audio-langage LFM 2.5
Le modèle audio-langage est sorti dans le cadre de la version 1,2 milliard, couvrant la compréhension de la parole et les réponses à des questions audio. Parmi les applications potentielles : assistants vocaux, résumés de réunions et outils d'accessibilité, le tout fonctionnant hors ligne pour préserver la confidentialité.
8. Ce qui a changé entre LFM 2.0 et LFM 2.5
Le bond en avant est considérable. Liquid AI a doublé le vocabulaire pour atteindre 128K en étendant le tokenizer existant plutôt qu'en repartant de zéro, afin de mieux gérer les écritures non latines. L'entraînement a lui aussi changé d'échelle, avec le modèle MoE 8B entraîné sur 38 000 milliards de tokens, complété par du RL à grande échelle. LFM 2.5 apporte également une fenêtre de contexte de 128K, du raisonnement, ainsi que des modèles multimodaux Vision et Audio, absents de la version 2.0.
9. Licence et disponibilité commerciale
Ce que permet la licence
Les modèles sont distribués sous la propre licence de Liquid. Le modèle de base et sa variante agentique post-entraînée sont tous deux disponibles sur Hugging Face sous la licence LFM Open License v1.0, qui autorise l'usage commercial. Cela dit, comme il s'agit d'une licence propre à Liquid plutôt que d'une licence permissive standard, mieux vaut bien lire les conditions avant de bâtir un projet commercial dessus.
Où accéder à LFM 2.5
Vous pouvez télécharger les poids et les fiches de modèle depuis Hugging Face, ou accéder aux modèles via OpenRouter et l'API maison de Liquid AI pour du prototypage rapide.
10. Comment démarrer et déployer LFM 2.5
Démarrage rapide via l'API
Créez un compte sur OpenRouter ou Liquid AI, récupérez une clé API, choisissez votre variante via l'endpoint, puis envoyez une requête de test. C'est le chemin le plus rapide pour obtenir un prototype fonctionnel.
Installation locale via Hugging Face
Installez votre stack d'inférence, téléchargez les poids de la variante choisie depuis la fiche du modèle sur Hugging Face, puis lancez l'inférence en local. Le support est assuré dès le premier jour sur llama.cpp, MLX, vLLM et SGLang, avec des poids ouverts pour le modèle de base comme pour la version post-entraînée.
Déploiement en edge
Pour Raspberry Pi et mobile, utilisez des formats quantifiés comme GGUF avec INT4/INT8. Pour le modèle phare MoE sur GPU, prévoyez une carte capable de gérer l'ensemble des ~8 milliards de paramètres (environ 17 Go en BF16, plus le cache KV), même si seul ~1 milliard de paramètres est actif par token, visez un GPU avec au moins 24 Go de VRAM.
11. Une valeur bien réelle : applications business et personnelles
Pour les développeurs individuels et les passionnés
Créez des applis IA en mode offline sur du matériel grand public, sans coût d'API récurrent, et expérimentez librement via Hugging Face.
Pour les entreprises
Un déploiement privé, sur site, qui élimine les risques liés au partage de données, réduit les coûts d'inférence par rapport aux API de type GPT-4 à grande échelle, et permet un fine-tuning vertical sur des données propriétaires.
Pour les industries de l'edge et de l'IoT
Contrôle qualité en production avec le modèle de vision, agents pour la maison connectée et la robotique avec le 8B-A1B, et aide au diagnostic dans les zones à connectivité limitée : tout ça devient accessible.
Vous développez un produit IA mais vous continuez à cramer du cash sur des abonnements cloud ? Bleap vous offre 0% de frais de change sur la facturation en USD et 20% de cashback flat sur Claude, ChatGPT et Gemini, avec une Mastercard auto-custodiale et sans abonnement mensuel. Obtenir la carte Bleap →
Questions fréquentes sur LFM 2.5
De quel matériel LFM 2.5 a-t-il besoin, et peut-il vraiment tourner sur un Raspberry Pi ?
Oui. Les variantes les plus légères tournent sur du matériel contraint grâce à la quantisation. LFM2.5-230M atteint 42 tokens par seconde sur un Pi 5, tandis que l'agent 2.6B fonctionne avec moins de 2,5 Go de mémoire, avec environ 30 tokens par seconde sur un smartphone.
Comment LFM 2.5 se compare-t-il à DeepSeek et Qwen à nombre de paramètres égal ?
Face à Qwen, LFM2.5-2.6B arrive en tête sur tous les benchmarks de suivi d'instructions et sur presque tous les benchmarks d'utilisation d'outils, ne cédant qu'à Qwen3.5-9B sur BFCLv4. Son efficacité en paramètres actifs se traduit par un coût de calcul par token bien plus faible que les modèles denses concurrents ou les modèles cloud plus volumineux comme DeepSeek-V4-Flash.
LFM 2.5 est-il gratuit pour un usage commercial ?
Globalement, oui. Les poids sont disponibles sur Hugging Face sous la LFM Open License v1.0, qui autorise l'usage commercial, mais il vaut mieux lire attentivement les termes de la licence avant de construire un produit commercial dessus.
Où puis-je télécharger ou accéder aux modèles LFM 2.5 ?
Sur Hugging Face pour les poids, et via OpenRouter ou l'API Liquid AI pour un accès hébergé.
LFM 2.5 gère-t-il l'image et l'audio, ou seulement le texte ?
Il est multimodal. Cette version inclut des modèles Base, Instruct, Japonais, Vision-Language et Audio-Language.
Quelle est la vitesse d'inférence de LFM 2.5 comparée à des modèles de taille similaire ?
Très rapide pour sa catégorie. LFM2.5-2.6B atteint près de 15 000 tokens de sortie par seconde à forte concurrence, grâce à son architecture basée sur des convolutions courtes et son routage MoE sparse.
Conclusion : LFM 2.5, le modèle d'IA embarquée à surveiller ?
LFM 2.5 mérite qu'on s'y attarde : des benchmarks compétitifs, un support multimodal natif, et une architecture assez puissante pour des agents en entreprise tout en restant assez légère pour tourner sur un Raspberry Pi. Développeurs qui prototypent des agents, entreprises qui évaluent des solutions d'IA privée, ingénieurs en hardware embarqué : tout le monde a intérêt à s'y intéresser dès maintenant, en commençant par Hugging Face ou l'API.
Et quels que soient les outils d'IA que vous utilisez à côté, payez-les intelligemment. Avec Bleap, vous évitez les frais de change sur vos abonnements en dollars, et sur Claude, ChatGPT et Gemini, vous touchez 20% de cashback à chaque renouvellement, grâce à une Mastercard self-custodial et sans abonnement associé.
Une façon plus intelligente de dépenser, envoyer, gagner et trader









