Blogs

LFM 2.5: Architectuur, Benchmarks en Waarom Het Belangrijk Is voor Edge AI

13 August 2026  ·  Bijgewerkt 14 August 2026

Gabriel Caetano

Gabriel Caetano

LFM 2.5: Architectuur, Benchmarks en Waarom Het Belangrijk Is voor Edge AI

LFM 2.5 is Liquid AI’s nieuwe modelfamilie voor edge-AI, ontworpen voor snelle, private AI op het apparaat zelf. De modellen draaien op telefoons, laptops en Raspberry Pi en leveren sterke prestaties voor reasoning, tools en multimodale taken.

lfm-2-5-architecture-benchmarks-edge-ai

Alles over de nieuwe LFM 2.5: architectuur, benchmarks en waarom het ertoe doet voor edge AI

Krachtige AI draaien zonder cloudrekening is niet langer een droom. LFM 2.5 is de nieuwste modelfamilie van Liquid AI voor on-device foundation models, en de vlaggenschip-agent, LFM2.5-2.6B, past in minder dan 2,5 GB geheugen, draait op zo'n 30 tokens per seconde op hardware van telefoonniveau, en presteert net zo goed of beter dan modellen die meerdere keren groter zijn op bepaalde benchmarks. Dat maakt private, offline AI echt praktisch bruikbaar. Houd er wel rekening mee dat de opvallende cijfers afkomstig zijn van Liquid AI's eigen benchmarks, dus beschouw ze als claims totdat onafhankelijke tests ze bevestigen.

Deze gids legt uit wat LFM 2.5 is, hoe de architectuur werkt, hoe de varianten zich verhouden tot Gemma, Qwen en DeepSeek, en hoe je het inzet. Als je daarnaast ook leunt op cloud-AI-abonnementen zoals Claude, ChatGPT of Gemini voor zwaardere klussen, is er een slimmere manier om daarvoor te betalen, daar komen we straks op terug.

Bouw je lokale agents, maar betaal je toch nog voor cloud-AI ernaast? Bleap rekent 0% wisselkoerskosten op je USD-abonnementen en geeft een vaste 20% cashback op verlengingen van Claude, ChatGPT en Gemini, zonder eigen abonnementskosten. (De 20% cashback geldt alleen voor deze drie tools.) Vraag de Bleap-kaart aan →

1. Wat is LFM 2.5? Overzicht en architectuur

LFM 2.5 is de nieuwste generatie Liquid Foundation Models, ontwikkeld door Liquid AI, een bedrijf opgericht door voormalige MIT-computerwetenschappers. De hele familie draait om één doel: krachtige AI die op je eigen apparaat draait, niet in een datacenter ver weg.

De kern van de innovatie is een hybride architectuur. LFM2.5-2.6B is een model met 2,69 miljard parameters, opgebouwd uit 30 lagen (22 dubbel-gepoorte short convolution-blokken en 8 GQA-lagen), met een vocabulaire van 128K en een contextvenster van 131.072 tokens. Door de meeste attention-lagen te vervangen door short convolutions, gebruikt het model minder geheugen en werkt inferentie sneller op gewone CPU's.

Hoe het Mixture of Experts-ontwerp werkt

Het meest efficiënte topmodel bouwt een Mixture of Experts (MoE)-ontwerp bovenop die architectuur. LFM2.5-8B-A1B gebruikt een sparse MoE-opzet die per forward pass 1,5 miljard van de in totaal 8,3 miljard parameters activeert, waardoor elk gegenereerd token goedkoop te berekenen blijft. Elke MoE-laag heeft 32 experts en selecteert per token de top-k=4 experts, met behulp van een genormaliseerde sigmoid-router en adaptieve routing-biases voor loadbalancing. Het resultaat: kwaliteit die aanvoelt als een 4B-klasse model, maar tegen decodekosten die dicht bij die van een 1,5B-model liggen, iets wat standaard transformer-only modellen simpelweg niet kunnen evenaren op beperkte hardware.

2. LFM 2.5-modelvarianten en -formaten

LFM 2.5 is niet één model, maar een hele reeks formaten en specialisaties.

LFM2.5-230M

Het kleinste model in de reeks. Liquid AI laat zien dat LFM2.5-230M een score van 43,26 haalt op de BFCLv3 tool-use benchmark, waarmee het IBM's Granite 4.0-350M (39,58) achter zich laat en zelfs grotere modellen met 1 miljard parameters zoals Google's Gemma 3 1B IT (16,61) voorbijstreeft. Het model is gebouwd voor gestructureerde tool-calls en data-extractie.

LFM2.5-1.2B-familie

Dit is een uitgebreide release met Base-, Instruct-, Japanse, Vision-Language- en Audio-Language-modellen. Liquid AI heeft de pretraining uitgebreid van 10T naar 28T tokens en de post-training opgeschaald met reinforcement learning.

LFM2.5-2.6B

De veelzijdige, telefoonklare agent. Hij maakt plannen, roept tools aan en werkt taken met meerdere stappen af op telefoons, laptops, pc's en robots.

LFM2.5-8B-A1B (MoE)

Het vlaggenschip op het gebied van redeneren. In tegenstelling tot zijn voorganger is LFM2.5-8B-A1B een model dat uitsluitend redeneert en een expliciete gedachtegang laat zien voordat het met een definitief antwoord komt.

Variant

Totaal aantal parameters

Actieve parameters

Primair gebruik

Beste hardware

LFM2.5-230M

230M

230M

Tool-calls, extractie

Telefoon, Raspberry Pi

LFM2.5-1.2B

1,2B

1,2B

Multimodaal, meertalig

Telefoon, laptop

LFM2.5-2.6B

2,69B

2,69B

On-device agents

Laptop, telefoon

LFM2.5-8B-A1B

8,3B

1,5B

Redeneren, agentic loops

Eén 24GB GPU of CPU

3. On-Device en Edge AI-mogelijkheden

Het hele idee achter LFM 2.5 is dat het draait zonder cloud of GPU nodig te hebben.

LFM 2.5 draaien op Raspberry Pi en mobiele hardware

De cijfers spreken voor zich. LFM2.5-230M haalt 213 tokens per seconde op een Galaxy S25 Ultra en 42 tokens per seconde op een Pi 5. Voor de grotere agent mat Liquid AI 220 tokens per seconde decodering op een Apple M5 Max, 113 tokens per seconde op een AMD Ryzen AI Max+ 395, en ongeveer 30 tokens per seconde op een telefoon, allemaal met minder dan 2,5 GB geheugen.

Voordelen van privacy en offline AI

Omdat de inferentie lokaal blijft, verlaat data het apparaat nooit en zijn de marginale kosten per run vrijwel nihil. Dat is precies waar het om draait bij zorg-, juridische en financiële toepassingen, in air-gapped omgevingen, en overal waar een cloud API-rekening anders flink zou oplopen bij schaalvergroting.

4. LFM 2.5 Benchmarks en prestatieresultaten

Liquid AI vergelijkt de resultaten met Gemma 4- en Qwen 3.5-varianten aan de hand van zijn eigen evaluatiesuite.

Tekst- en redeneerbenchmarks

Voor het redeneermodel zijn de verbeteringen ten opzichte van de voorganger flink. LFM2.5-8B-A1B gaat er over de hele linie op vooruit: de AA-Omniscience Non-Hallucination Rate steeg van 7,46 naar 63,47 en IFEval ging van 79,44 naar 91,84.

Wiskunde- en agentic-taakbenchmarks

MATH500 klom van 74,80 naar 88,76 en Tau² Telecom steeg van 13,60 naar 88,07. Bij de kleinere agent gaat LFM2.5-2.6B aan kop op vrijwel elke benchmark voor het volgen van instructies en bijna elke benchmark voor tool-gebruik, en is alleen op BFCLv4 net iets minder goed dan Qwen3.5-9B. Op agentic taken presteert het model over de hele linie beter dan beide Gemma-modellen.

Vision- en audiobenchmarks

Ook de multimodale checkpoints houden goed stand. LFM2.5-VL-1.6B laat sterkere prestaties zien bij het volgen van instructies, zowel op vision- als tekstbenchmarks, waardoor het een prima keuze is voor multimodale toepassingen op edge-apparaten.

Inferentiesnelheid-benchmarks

Snelheid is echt de uitschieter. LFM2.5-2.6B is het snelste model in zijn gewichtsklasse en haalt bij hoge concurrency bijna 15K output tokens per seconde, oftewel ruwweg 1,3 miljard tokens per dag op één enkele H100.

Ben je lokaal agents aan het prototypen, maar huur je voor de lastige onderdelen cloudmodellen in? Betaal die USD-abonnementen met Bleap zonder wisselkoerskosten, én met 20% platte cashback op Claude, ChatGPT en Gemini. Self-custodial Mastercard, geen maandelijkse kosten. Vraag de Bleap-kaart aan →

5. LFM 2.5 vs. concurrentie: rechtstreekse vergelijkingen

LFM 2.5 vs. DeepSeek-V4-Flash

DeepSeek-V4-Flash is een sterk, cloud-georiënteerd agentmodel. Het voordeel van LFM 2.5 zit in de inzetbaarheid: het draait op een telefoon of Raspberry Pi zonder GPU, terwijl een model uit de Flash-klasse serverhardware vereist. Werk je met edge-toepassingen, dan is LFM 2.5 duidelijk de betere keuze.

LFM 2.5 vs. Google Gemma

Liquid AI vergelijkt zich rechtstreeks met de Gemma 4-varianten. Getest tegen onder andere gemma-4-E2B-it (5,1B) en gemma-4-E4B-it (8B), is LFM2.5-2.6B toonaangevend in elke instructie-volgende benchmark en elke tool-use benchmark, behalve BFCLv4. Gemma houdt een voorsprong op het gebied van programmeren.

LFM 2.5 vs. Alibaba Qwen

Qwen 3.5 is de dichtstbijzijnde concurrent qua capaciteiten. Bij agentische taken houdt LFM2.5-2.6B gelijke tred met de Qwen-modellen, loopt het voorop bij AA-Omniscience-Public, en verliest het alleen van Qwen3.5-9B op het gebied van wiskunde. Programmeren is het enige terrein waar de grotere modellen een voorsprong behouden. Op het vlak van efficiëntie van actieve parameters trekt LFM 2.5 juist aan het langste eind qua kosten per token.

De conclusie: LFM 2.5 levert concurrerende nauwkeurigheid bij aanzienlijk lager rekenverbruik, en vult daarmee een niche in die grotere modellen niet kunnen bereiken.

6. De filosofie achter Agentic AI Design

LFM 2.5 is in de eerste plaats gebouwd voor agents, en pas daarna voor chat.

Tool-gebruik en agentic workflows

De modellen ondersteunen native function calling en meerstaps-planning. Het MoE-ontwerp speelt hier een belangrijke rol: minder actieve parameters betekenen snellere doorloop van agentic loops. Omdat er geen kosten per token zijn, kunnen achtergrondagents continu en parallel draaien, iets wat bij betaalde cloud-API's structureel onmogelijk is. Zo kunnen agents op lokale hardware massaal parallel draaien zonder extra kosten.

Praktische toepassingen voor agentic AI

Denk bijvoorbeeld aan on-device assistenten, offline documentanalyse met inputs tot 128K, het extraheren van gegevens uit formulieren en facturen, het interpreteren van robotica-commando's en achtergrondagents die continu draaien zonder kosten per token. Wees hier wel realistisch over: Liquid AI raadt het model expliciet af voor agentic coding of taken die veel specifieke kennis vereisen.

7. Multimodale mogelijkheden: beeld en geluid

LFM 2.5 is een multimodale modelfamilie, geen tekst-only model.

LFM 2.5 Vision-Language Model

Het vision-checkpoint verwerkt afbeeldingen, grafieken en documenten naast tekst. De 1.6B VL-variant is geoptimaliseerd voor sterke instructieopvolging op edge-apparaten, wat perfect past bij mobiele workflows voor documenten en afbeeldingen.

LFM 2.5 Audio-Language Model

Het audio-language model werd uitgebracht als onderdeel van de 1.2B-release en richt zich op spraakbegrip en het beantwoorden van vragen op basis van audio. Denk aan toepassingen zoals spraakassistenten, samenvattingen van vergaderingen en toegankelijkheidstools, allemaal offline te gebruiken voor optimale privacy.

8. Wat er is veranderd van LFM 2.0 naar LFM 2.5

De sprong is aanzienlijk. Liquid AI heeft de vocabulaire verdubbeld naar 128K door de tokenizer uit te breiden in plaats van hem opnieuw te trainen, om niet-Latijnse schriften beter te ondersteunen. De training is flink opgeschaald: het 8B MoE-model is getraind op 38T tokens plus grootschalige RL. LFM 2.5 kreeg daarnaast een contextvenster van 128K, reasoning en multimodale Vision- en Audio-modellen die in versie 2.0 nog niet aanwezig waren.

9. Licentie en commerciële beschikbaarheid

Wat de licentie toestaat

De modellen worden uitgebracht onder Liquid's eigen licentie. Zowel het basismodel als de agentic post-trained variant staan op Hugging Face onder de LFM Open License v1.0, die commercieel gebruik toestaat. Toch valt het model onder Liquid's eigen licentie in plaats van een standaard permissieve licentie, dus wie commerciële plannen heeft, doet er goed aan de voorwaarden eerst goed door te lezen voordat hij ermee aan de slag gaat.

Waar je LFM 2.5 kunt vinden

Je kunt de weights en modelkaarten downloaden via Hugging Face, of de modellen benaderen via OpenRouter en Liquid AI's eigen API voor snel prototypen.

10. Aan de slag met en implementeren van LFM 2.5

Snel starten via de API

Maak een account aan bij OpenRouter of Liquid AI, vraag een API-key aan, kies je variant via het endpoint en stuur een testverzoek. Dit is de snelste weg naar een werkend prototype.

Lokale installatie via HuggingFace

Installeer je inference-stack, download de weights voor de gekozen variant vanaf de Hugging Face-modelkaart en voer inference lokaal uit. Vanaf dag één wordt ondersteuning geboden voor llama.cpp, MLX, vLLM en SGLang, met open basis- en post-trained weights.

Edge-implementatie

Voor Raspberry Pi en mobiele toepassingen gebruik je gekwantiseerde formaten zoals GGUF met INT4/INT8. Voor het MoE-vlaggenschip op GPU moet je de GPU dimensioneren voor de volledige ~8B aan weights (≈17 GB BF16 plus KV-cache), ook al is er slechts ~1B actief per token, richt je op een GPU met minimaal 24 GB VRAM.

11. Praktische waarde: zakelijke en persoonlijke toepassingen

Voor individuele developers en hobbyisten

Bouw offline AI-apps op consumentenhardware zonder terugkerende API-kosten en experimenteer vrij via Hugging Face.

Voor bedrijven

Een private, on-premises implementatie elimineert het risico van datadeling, verlaagt de inferentiekosten in vergelijking met GPT-4-achtige API's op schaal, en maakt verticale fine-tuning op eigen data mogelijk.

Voor edge- en IoT-sectoren

Kwaliteitscontrole in de productie met het vision-model, smart-home- en robotica-agents met de 8B-A1B, en diagnostische ondersteuning in regio's met beperkte connectiviteit: het ligt allemaal binnen handbereik.

Breng je een AI-product uit, maar verbrand je nog steeds geld aan cloud-modelabonnementen? Bleap geeft je 0% wisselkosten op USD-facturen en een vaste 20% cashback op Claude, ChatGPT en Gemini, met een selfcustodial Mastercard en zonder maandelijks abonnement. Vraag de Bleap-kaart aan →

Veelgestelde vragen over LFM 2.5

Welke hardware heeft LFM 2.5 nodig, en draait het echt op een Raspberry Pi?

Ja, dat klopt. De kleinere varianten draaien met quantisatie prima op hardware met beperkte capaciteit. LFM2.5-230M haalt 42 tokens per seconde op een Pi 5, terwijl de 2,6B-agent onder de 2,5 GB geheugen blijft, met ongeveer 30 tokens per seconde op een telefoon.

Hoe verhoudt LFM 2.5 zich tot DeepSeek en Qwen bij hetzelfde aantal parameters?

Vergeleken met Qwen scoort LFM2.5-2.6B beter op elke instruction-following benchmark en bijna elke tool-use benchmark, en blijft alleen achter bij Qwen3.5-9B op BFCLv4. Dankzij de efficiëntie van actieve parameters verbruikt het model veel minder rekenkracht per token dan dichtere concurrenten of grotere cloudmodellen zoals DeepSeek-V4-Flash.

Is LFM 2.5 gratis te gebruiken voor commerciële doeleinden?

Grotendeels wel. De weights staan op Hugging Face onder de LFM Open License v1.0, die commercieel gebruik toestaat. Lees wel eerst de licentievoorwaarden goed door voordat je er een commercieel product op bouwt.

Waar kan ik LFM 2.5-modellen downloaden of gebruiken?

Voor de weights kun je terecht op Hugging Face, en voor gehoste toegang via OpenRouter of de Liquid AI API.

Ondersteunt LFM 2.5 beeld en audio, of alleen tekst?

Het is multimodaal. Deze release omvat Base-, Instruct-, Japanse, Vision-Language- en Audio-Language-modellen.

Hoe snel is LFM 2.5 in vergelijking met modellen van vergelijkbare omvang?

Erg snel voor zijn klasse. LFM2.5-2.6B haalt bij hoge gelijktijdigheid bijna 15K output-tokens per seconde, dankzij de short-convolution-architectuur en sparse MoE-routing.

Conclusie: is LFM 2.5 het edge-AI-model om in de gaten te houden?

LFM 2.5 verdient de aandacht: sterke benchmarks, native multimodale ondersteuning en een architectuur die krachtig genoeg is voor enterprise agents, maar toch licht genoeg voor een Raspberry Pi. Developers die agents aan het prototypen zijn, bedrijven die private AI overwegen en edge-hardware engineers doen er goed aan er nu serieus naar te kijken, te beginnen op Hugging Face of via de API.

En welke AI-tools je er ook naast gebruikt, betaal slim. Met Bleap sla je de wisselkoerskosten op USD-abonnementen over, en op Claude, ChatGPT en Gemini krijg je 20% cashback bij elke verlenging, met een self-custodial Mastercard en zonder eigen abonnement.

Een slimmere manier om te betalen, verzenden, verdienen en traden

Afbeelding sectie Belangrijkste punten

Gerelateerde artikelen