LFM 2.5: Architettura, Benchmark e Perché Conta per l’Edge AI
13 August 2026 · Aggiornato 14 August 2026

Gabriel Caetano
LFM 2.5: Architettura, Benchmark e Perché Conta per l’Edge AI
LFM 2.5 è la nuova famiglia di modelli edge di Liquid AI, progettata per un’AI veloce, privata e locale. Funziona su smartphone, laptop e Raspberry Pi offrendo ottime prestazioni in reasoning, tool use e multimodalità.

Tutto su LFM 2.5: architettura, benchmark e perché conta per l'Edge AI
Far girare un'AI performante senza dover pagare il conto del cloud non è più fantascienza. LFM 2.5 è la nuova famiglia di modelli fondazionali on-device di Liquid AI, e il suo agente di punta, LFM2.5-2.6B, occupa meno di 2,5 GB di memoria, gira a circa 30 token al secondo su hardware da smartphone, e batte o pareggia modelli molte volte più grandi su alcuni benchmark selezionati. Tutto questo rende l'AI privata e offline davvero praticabile. Va detto però che i numeri più eclatanti sono benchmark forniti direttamente da Liquid AI, quindi vanno presi come dichiarazioni fino a quando non saranno confermati da test indipendenti.
In questa guida vediamo cos'è LFM 2.5, come funziona la sua architettura, come le varie versioni si confrontano con Gemma, Qwen e DeepSeek, e come metterlo in pratica. E se per i lavori più pesanti ti appoggi anche ad abbonamenti AI in cloud come Claude, ChatGPT o Gemini, esiste un modo più intelligente per pagarli, di cui parliamo tra poco.
Costruisci agenti in locale ma continui a pagare per l'AI in cloud a parte? Con Bleap non paghi commissioni FX sui tuoi abbonamenti in USD e ottieni un cashback fisso del 20% sui rinnovi di Claude, ChatGPT e Gemini, senza alcun abbonamento da parte nostra. (Il cashback del 20% si applica solo a questi tre strumenti.) Scopri la carta Bleap →
1. Cos'è LFM 2.5? Panoramica e architettura
LFM 2.5 è l'ultima generazione dei Liquid Foundation Models, sviluppati da Liquid AI, azienda fondata da ex informatici del MIT. La famiglia punta su un solo obiettivo: un'intelligenza potente che funziona direttamente sul dispositivo che hai davanti, non in un data center.
L'innovazione principale sta in un'architettura ibrida. LFM2.5-2.6B è un modello con 2,69 miliardi di parametri e 30 livelli (22 blocchi a convoluzione corta double-gated e 8 livelli GQA), un vocabolario di 128K e una finestra di contesto di 131.072 token. Sostituire la maggior parte dei livelli di attenzione con convoluzioni corte riduce il consumo di memoria e velocizza l'inferenza anche su normali CPU.
Come funziona il design Mixture of Experts
Il modello di punta per l'efficienza aggiunge un design Mixture of Experts (MoE) sopra questa architettura di base. LFM2.5-8B-A1B utilizza un design MoE sparso che attiva 1,5 miliardi dei suoi 8,3 miliardi di parametri totali a ogni passaggio, mantenendo basso il costo di calcolo per ogni token generato. Ogni livello MoE ha 32 esperti e seleziona i top-k=4 esperti per token tramite un router sigmoide normalizzato e bias di instradamento adattivi per il bilanciamento del carico. Il risultato è una qualità paragonabile a un modello da 4B, ma con un costo di decodifica vicino a quello di un modello da 1,5B, un livello che i modelli transformer-only tradizionali non riescono a raggiungere su hardware con risorse limitate.
2. Varianti e dimensioni del modello LFM 2.5
LFM 2.5 non è un unico modello, ma una gamma di dimensioni e specializzazioni diverse.
LFM2.5-230M
Il checkpoint più piccolo. Liquid AI mostra LFM2.5-230M con un punteggio di 43,26 nel benchmark BFCLv3 per l'uso di strumenti, superando nettamente Granite 4.0-350M di IBM (39,58) e battendo modelli più grandi da un miliardo di parametri come Gemma 3 1B IT di Google (16,61). È pensato per chiamate a strumenti strutturate ed estrazione dati.
Famiglia LFM2.5-1.2B
Si tratta di un rilascio completo che comprende modelli Base, Instruct, Giapponese, Vision-Language e Audio-Language. Liquid AI ha esteso il pre-training da 10T a 28T token e ha potenziato il post-training con reinforcement learning.
LFM2.5-2.6B
L'agente generico, pronto per gli smartphone. Pianifica, richiama strumenti e porta a termine attività multi-step su telefoni, laptop, PC e robot.
LFM2.5-8B-A1B (MoE)
Il modello di punta per il ragionamento. A differenza del suo predecessore, LFM2.5-8B-A1B è un modello dedicato esclusivamente al ragionamento, che produce una catena di pensiero esplicita prima di dare la risposta finale.
Variante | Parametri totali | Parametri attivi | Uso principale | Hardware consigliato |
|---|---|---|---|---|
LFM2.5-230M | 230M | 230M | Chiamate a strumenti, estrazione | Telefono, Raspberry Pi |
LFM2.5-1.2B | 1,2B | 1,2B | Multimodale, multilingue | Telefono, laptop |
LFM2.5-2.6B | 2,69B | 2,69B | Agenti on-device | Laptop, telefono |
LFM2.5-8B-A1B | 8,3B | 1,5B | Ragionamento, loop agentici | Singola GPU da 24GB o CPU |
3. Capacità di AI on-device ed edge
Il punto di forza di LFM 2.5 è proprio questo: funziona senza cloud e senza GPU.
LFM 2.5 su Raspberry Pi e dispositivi mobili
I numeri parlano chiaro. LFM2.5-230M raggiunge 213 token al secondo su un Galaxy S25 Ultra e 42 token al secondo su un Pi 5. Per l'agente più grande, Liquid AI ha misurato 220 token al secondo in decoding su un Apple M5 Max, 113 token al secondo su un AMD Ryzen AI Max+ 395 e circa 30 token al secondo su smartphone, tutto restando sotto i 2,5 GB di memoria.
Privacy e vantaggi dell'AI offline
Dato che l'inferenza resta locale, i dati non lasciano mai il dispositivo e il costo marginale di ogni esecuzione è praticamente nullo. Un aspetto fondamentale per settori come sanità, legale e finanza, per gli ambienti air-gapped e per tutti i casi in cui una bolletta di API cloud lieviterebbe rapidamente su larga scala.
4. Benchmark e risultati delle performance di LFM 2.5
Liquid AI confronta i suoi modelli con le varianti di Gemma 4 e Qwen 3.5 usando la propria suite di valutazione.
Benchmark su testo e ragionamento
Per il modello di ragionamento, i miglioramenti rispetto al predecessore sono notevoli. LFM2.5-8B-A1B migliora su tutta la linea: l'AA-Omniscience Non-Hallucination Rate è passato da 7,46 a 63,47 e IFEval è salito da 79,44 a 91,84.
Benchmark su matematica e task agentici
MATH500 è passato da 74,80 a 88,76 e Tau² Telecom è salito da 13,60 a 88,07. Per l'agente più piccolo, LFM2.5-2.6B è in testa su tutti i benchmark di instruction-following e quasi tutti quelli di tool-use, restando indietro solo rispetto a Qwen3.5-9B su BFCLv4, e supera entrambi i modelli Gemma su tutta la linea nei task agentici.
Benchmark su visione e audio
I checkpoint multimodali se la cavano bene. LFM2.5-VL-1.6B mostra prestazioni migliori nell'instruction-following sia nei benchmark visivi che testuali, il che lo rende una buona scelta per le applicazioni multimodali on-edge.
Benchmark sulla velocità di inferenza
La velocità è il punto di forza. LFM2.5-2.6B è il modello più rapido nella sua classe dimensionale, raggiungendo quasi 15K token di output al secondo con alta concorrenza, circa 1,3 miliardi di token al giorno su una singola H100.
Stai prototipando agenti in locale, ma noleggi modelli cloud per le parti più complesse? Paga quegli abbonamenti in USD con Bleap a 0% di commissioni FX, più un cashback flat del 20% su Claude, ChatGPT e Gemini. Mastercard self-custodial, senza costi mensili. Scopri la carta Bleap →
5. LFM 2.5 vs. Competitor: Confronto Diretto
LFM 2.5 vs. DeepSeek-V4-Flash
DeepSeek-V4-Flash è un modello agentico solido, pensato per il cloud. Il vantaggio di LFM 2.5 sta nella facilità di distribuzione: funziona su uno smartphone o un Raspberry Pi senza bisogno di GPU, mentre un modello di classe Flash richiede hardware server. Se il tuo carico di lavoro vive sull'edge, LFM 2.5 è la scelta giusta.
LFM 2.5 vs. Google Gemma
Liquid AI si confronta direttamente con le varianti di Gemma 4. Nei test rispetto a gemma-4-E2B-it (5.1B) e gemma-4-E4B-it (8B), tra gli altri, LFM2.5-2.6B è al primo posto in tutti i benchmark di instruction-following e in tutti quelli sull'uso di tool, eccetto BFCLv4. Gemma mantiene invece un vantaggio nel coding.
LFM 2.5 vs. Alibaba Qwen
Qwen 3.5 è il rivale più vicino in termini di capacità. Sui task agentici, LFM2.5-2.6B se la gioca alla pari con i modelli Qwen, è in testa su AA-Omniscience-Public, è secondo solo a Qwen3.5-9B in matematica, e il coding resta l'unico ambito in cui i modelli più grandi mantengono un vantaggio. È sull'efficienza dei parametri attivi che LFM 2.5 prende il sopravvento in termini di costo per token.
Il punto è questo: LFM 2.5 offre un'accuratezza competitiva con un consumo di calcolo drasticamente inferiore, occupando una nicchia che i modelli più grandi non possono raggiungere.
6. Filosofia di design dell'AI agentica
LFM 2.5 è pensato prima per gli agenti, poi per la chat.
Uso di tool e workflow agentici
I modelli supportano il function calling nativo e la pianificazione multi-step. Qui il design MoE fa la differenza: meno parametri attivi significano iterazioni più rapide nei loop agentici. Il costo zero per token permette il parallelismo continuo di agenti in background, uno schema che le API cloud a consumo impediscono per loro stessa natura, quindi gli agenti possono essere massicciamente parallelizzati su hardware locale senza costi marginali.
Casi d'uso agentici pratici
Tra gli utilizzi concreti troviamo assistenti on-device, smistamento offline di documenti su input fino a 128K token, estrazione dati da form e fatture, parsing di comandi per robotica, e agenti in background che funzionano continuamente senza costi per token. Va detto con onestà, però, che Liquid AI dichiara esplicitamente di non consigliare il modello per coding agentico o compiti che richiedono molta conoscenza.
7. Capacità multimodali: visione e audio
LFM 2.5 è una famiglia multimodale, non un modello solo testuale.
LFM 2.5 Vision-Language Model
Il checkpoint per la visione gestisce immagini, grafici e documenti insieme al testo, e la variante VL da 1,6B è ottimizzata per un forte instruction-following su dispositivi edge, il che la rende adatta a workflow mobile per documenti e immagini.
LFM 2.5 Audio-Language Model
Il modello audio-language è stato rilasciato come parte della release da 1,2B, e copre la comprensione del parlato e il question answering audio. Le applicazioni potenziali includono assistenti vocali, riassunti di riunioni e strumenti di accessibilità, il tutto funzionante offline per garantire la privacy.
8. Cosa è cambiato tra LFM 2.0 e LFM 2.5
Il salto è notevole. Liquid AI ha raddoppiato il vocabolario portandolo a 128K, estendendo il tokenizer esistente invece di riaddestrarlo da zero, per supportare meglio le scritture non latine. Il training è stato ampliato in modo drastico, con l'8B MoE addestrato su 38T token più un massiccio intervento di RL. LFM 2.5 ha introdotto anche una finestra di contesto da 128K, capacità di ragionamento e modelli multimodali Vision e Audio assenti nella versione 2.0.
9. Licenza e disponibilità commerciale
Cosa consente la licenza
I modelli vengono distribuiti con una licenza proprietaria di Liquid. Sia il modello base che la variante agentic post-addestrata sono disponibili su Hugging Face sotto la LFM Open License v1.0, che permette l'uso commerciale. Detto questo, il modello viene rilasciato con una licenza propria di Liquid e non con una licenza permissiva standard, quindi chi ha intenzioni commerciali dovrebbe leggere attentamente i termini prima di costruirci sopra qualcosa.
Dove trovare LFM 2.5
Puoi scaricare i pesi e le model card da Hugging Face, oppure accedere ai modelli tramite OpenRouter e l'API proprietaria di Liquid AI per prototipare rapidamente.
10. Come iniziare e mettere in produzione LFM 2.5
Avvio rapido via API
Crea un account su OpenRouter o Liquid AI, ottieni una chiave API, seleziona la variante che ti interessa tramite l'endpoint e invia una richiesta di prova. È la strada più veloce per avere un prototipo funzionante.
Configurazione locale via HuggingFace
Installa il tuo stack di inferenza, scarica i pesi della variante scelta dalla model card su Hugging Face ed esegui l'inferenza in locale. Il supporto è disponibile fin dal primo giorno per llama.cpp, MLX, vLLM e SGLang, con pesi open sia per il modello base che per quello post-addestrato.
Deployment su dispositivi edge
Per Raspberry Pi e dispositivi mobili, usa formati quantizzati come GGUF con INT4/INT8. Per il modello di punta MoE su GPU, dimensiona la GPU per l'intero peso di circa 8B (≈17 GB in BF16 più la cache KV), anche se solo circa 1B è attivo per token, puntando a una GPU con almeno 24 GB di VRAM.
11. Valore concreto: applicazioni per aziende e privati
Per sviluppatori indipendenti e appassionati
Crea app AI offline su hardware consumer senza costi ricorrenti per le API, sperimentando liberamente tramite Hugging Face.
Per le aziende
Il deployment privato, on-premises, elimina il rischio legato alla condivisione dei dati, riduce i costi di inferenza rispetto alle API di classe GPT-4 su larga scala, e permette un fine-tuning verticale su dati proprietari.
Per il settore edge e IoT
Controllo qualità nella produzione grazie al modello di visione, agenti per smart home e robotica con l'8B-A1B, e supporto diagnostico in aree con connettività limitata: tutto questo è ormai a portata di mano.
Stai lanciando un prodotto AI ma continui a bruciare soldi con gli abbonamenti ai modelli cloud? Con Bleap ottieni 0% di commissioni sul cambio valuta per la fatturazione in USD e un cashback fisso del 20% su Claude, ChatGPT e Gemini, con una Mastercard self-custodial e nessun abbonamento mensile. Scopri la carta Bleap →
Domande frequenti su LFM 2.5
Che hardware serve per LFM 2.5, e può davvero girare su un Raspberry Pi?
Sì. Le varianti più piccole funzionano anche su hardware limitato grazie alla quantizzazione. LFM2.5-230M raggiunge i 42 token al secondo su un Pi 5, mentre l'agente da 2,6B gira con meno di 2,5 GB di memoria, arrivando a circa 30 token al secondo anche su smartphone.
Come si confronta LFM 2.5 con DeepSeek e Qwen a parità di parametri?
Rispetto a Qwen, LFM2.5-2.6B è in testa in ogni benchmark di instruction-following e in quasi tutti quelli sull'uso di strumenti, restando indietro solo rispetto a Qwen3.5-9B su BFCLv4. La sua efficienza in termini di parametri attivi si traduce in un consumo computazionale per token molto più basso rispetto a modelli densi concorrenti o a modelli cloud più grandi come DeepSeek-V4-Flash.
LFM 2.5 è gratuito per uso commerciale?
In gran parte sì. I pesi sono disponibili su Hugging Face sotto la LFM Open License v1.0, che consente l'uso commerciale, ma è bene leggere attentamente i termini della licenza prima di costruirci sopra un prodotto commerciale.
Dove posso scaricare o accedere ai modelli LFM 2.5?
Su Hugging Face per i pesi, oppure tramite OpenRouter o l'API di Liquid AI per l'accesso hosted.
LFM 2.5 supporta immagini e audio, o solo testo?
È multimodale. Il rilascio include i modelli Base, Instruct, Japanese, Vision-Language e Audio-Language.
Quanto è veloce l'inferenza di LFM 2.5 rispetto a modelli di dimensioni simili?
Velocissima per la sua categoria. LFM2.5-2.6B raggiunge quasi 15K token di output al secondo con alta concorrenza, grazie al backbone a convoluzione breve e al routing sparso MoE.
Conclusione: LFM 2.5 è il modello AI edge da tenere d'occhio?
LFM 2.5 merita attenzione: benchmark competitivi, supporto multimodale nativo e un'architettura abbastanza potente per agenti enterprise ma leggera abbastanza da girare su un Raspberry Pi. Sviluppatori che prototipano agenti, aziende che valutano l'AI privata e ingegneri hardware edge dovrebbero dargli un'occhiata seria fin da ora, partendo da Hugging Face o dall'API.
E qualunque strumento AI usiate insieme a lui, pagate in modo intelligente. Con Bleap eviti le commissioni di cambio sugli abbonamenti in USD, e su Claude, ChatGPT e Gemini guadagni il 20% di cashback su ogni rinnovo, con una Mastercard self-custodial e nessun abbonamento da pagare.
Un modo più intelligente di spendere, inviare, guadagnare e fare trading









