LFM 2.5: Arquitetura, Benchmarks e Por Que Importa para Edge AI
13 August 2026 · Atualizado 14 August 2026

Gabriel Caetano
LFM 2.5: Arquitetura, Benchmarks e Por Que Importa para Edge AI
O LFM 2.5 é a nova família de modelos edge da Liquid AI, criada para IA rápida, privada e executada localmente. Funciona em celulares, laptops e Raspberry Pi, com forte desempenho em raciocínio, ferramentas e multimodalidade.

Tudo sobre o novo LFM 2.5: arquitetura, benchmarks e por que ele importa para a IA de borda
Rodar IA de verdade sem depender de uma fatura de nuvem já não é mais fantasia. O LFM 2.5 é a mais nova família de modelos de fundação para dispositivos locais da Liquid AI, e seu agente principal, o LFM2.5-2.6B, cabe em menos de 2,5 GB de memória, roda a cerca de 30 tokens por segundo em hardware de celular comum e supera ou empata com modelos várias vezes maiores em benchmarks selecionados. Isso torna a IA privada e offline algo realmente prático. Vale lembrar que os números divulgados são benchmarks da própria Liquid AI, então é bom tratá-los como afirmações até que testes independentes os confirmem.
Este guia explica o que é o LFM 2.5, como sua arquitetura funciona, como as variantes se comparam ao Gemma, Qwen e DeepSeek, e como implementá-lo. Se você também usa assinaturas de IA na nuvem, como Claude, ChatGPT ou Gemini, para tarefas mais pesadas, existe uma forma mais inteligente de pagar por elas também, que vamos abordar ao longo do texto.
Está construindo agentes localmente mas ainda paga por IA na nuvem à parte? A Bleap cobra 0% de taxa de câmbio nas suas assinaturas em dólar e dá 20% de cashback fixo nas renovações do Claude, ChatGPT e Gemini, sem nenhuma assinatura própria. (O cashback de 20% vale só para essas três ferramentas.) Peça o cartão Bleap →
1. O Que É o LFM 2.5? Visão Geral e Arquitetura
O LFM 2.5 é a mais nova geração dos Liquid Foundation Models, desenvolvidos pela Liquid AI, empresa fundada por ex-cientistas da computação do MIT. A família tem um objetivo central: oferecer inteligência poderosa que roda diretamente no dispositivo que você tem em mãos, sem depender de um data center.
A grande inovação está na estrutura híbrida do modelo. O LFM2.5-2.6B tem 2,69 bilhões de parâmetros distribuídos em 30 camadas (22 blocos de convolução curta com duplo gating e 8 camadas GQA), um vocabulário de 128 mil tokens e uma janela de contexto de 131.072 tokens. Ao substituir a maior parte das camadas de atenção por convoluções curtas, o modelo reduz o consumo de memória e acelera a inferência mesmo em CPUs comuns.
Como Funciona o Design de Mixture of Experts
O modelo mais eficiente da linha aplica um design de Mixture of Experts (MoE) sobre essa mesma estrutura. O LFM2.5-8B-A1B usa uma arquitetura MoE esparsa que ativa apenas 1,5 bilhão dos 8,3 bilhões de parâmetros totais a cada passagem, o que mantém o custo computacional de cada token gerado bem baixo. Cada camada MoE conta com 32 especialistas e seleciona os top-k=4 especialistas por token, usando um roteador sigmoide normalizado e vieses de roteamento adaptativos para balancear a carga. O resultado é uma qualidade próxima à de um modelo de 4 bilhões de parâmetros, mas com custo de decodificação parecido com o de um modelo de 1,5 bilhão, algo que modelos transformer tradicionais simplesmente não conseguem entregar em hardware limitado.
2. Variantes e Tamanhos do Modelo LFM 2.5
LFM 2.5 não é um único modelo, mas um leque de tamanhos e especializações.
LFM2.5-230M
O menor checkpoint. A Liquid AI mostra o LFM2.5-230M pontuando 43,26 no benchmark de uso de ferramentas BFCLv3, superando o Granite 4.0-350M da IBM (39,58) e deixando atrás modelos maiores, de 1 bilhão de parâmetros, como o Gemma 3 1B IT do Google (16,61). Ele foi criado para chamadas de ferramentas estruturadas e extração de dados.
Família LFM2.5-1.2B
Este é um lançamento completo, com modelos Base, Instruct, Japonês, Vision-Language e Audio-Language. A Liquid AI estendeu o pré-treinamento de 10T para 28T tokens e ampliou o pós-treinamento com aprendizado por reforço.
LFM2.5-2.6B
O agente de propósito geral, pronto para celulares. Ele planeja, aciona ferramentas e executa tarefas de múltiplas etapas em celulares, notebooks, PCs e robôs.
LFM2.5-8B-A1B (MoE)
O carro-chefe em raciocínio. Diferente de seu antecessor, o LFM2.5-8B-A1B é um modelo focado exclusivamente em raciocínio, que produz uma cadeia de pensamento explícita antes de chegar à resposta final.
Variante | Parâmetros totais | Parâmetros ativos | Uso principal | Melhor hardware |
|---|---|---|---|---|
LFM2.5-230M | 230M | 230M | Chamadas de ferramentas, extração | Celular, Raspberry Pi |
LFM2.5-1.2B | 1.2B | 1.2B | Multimodal, multilíngue | Celular, notebook |
LFM2.5-2.6B | 2.69B | 2.69B | Agentes no dispositivo | Notebook, celular |
LFM2.5-8B-A1B | 8.3B | 1.5B | Raciocínio, loops agênticos | GPU única de 24GB ou CPU |
3. Capacidades de IA no dispositivo e na borda (Edge AI)
Todo o propósito do LFM 2.5 é rodar sem depender de nuvem ou GPU.
Rodando o LFM 2.5 no Raspberry Pi e em hardware mobile
Os números falam por si só. O LFM2.5-230M roda a 213 tokens por segundo em um Galaxy S25 Ultra e 42 tokens por segundo em um Pi 5. Já para o agente maior, a Liquid AI mediu 220 tokens por segundo de decodificação em um Apple M5 Max, 113 tokens por segundo em um AMD Ryzen AI Max+ 395 e cerca de 30 tokens por segundo em um smartphone, tudo isso consumindo menos de 2,5 GB de memória.
Vantagens de privacidade e IA offline
Como a inferência acontece localmente, os dados nunca saem do dispositivo e o custo marginal de cada execução é praticamente zero. Isso faz toda a diferença para cargas de trabalho em saúde, jurídico e finanças, ambientes isolados da rede (air-gapped) e qualquer cenário em que a conta de uma API na nuvem explodiria em escala.
4. Benchmarks e Resultados de Desempenho do LFM 2.5
A Liquid AI faz comparações com as variantes do Gemma 4 e do Qwen 3.5 usando sua própria suíte de avaliação.
Benchmarks de Texto e Raciocínio
No modelo de raciocínio, os ganhos em relação ao antecessor são enormes. O LFM2.5-8B-A1B melhora em todas as frentes: a Taxa de Não Alucinação do AA-Omniscience saltou de 7,46 para 63,47, e o IFEval subiu de 79,44 para 91,84.
Benchmarks de Matemática e Tarefas Agênticas
O MATH500 subiu de 74,80 para 88,76, e o Tau² Telecom passou de 13,60 para 88,07. No agente menor, o LFM2.5-2.6B lidera em todos os benchmarks de seguimento de instruções e em quase todos os benchmarks de uso de ferramentas, ficando atrás apenas do Qwen3.5-9B no BFCLv4, e supera os dois modelos Gemma em todas as tarefas agênticas.
Benchmarks de Visão e Áudio
Os checkpoints multimodais também se destacam. O LFM2.5-VL-1.6B apresenta desempenho mais forte em seguimento de instruções, tanto nos benchmarks de visão quanto nos de texto, o que o torna uma boa escolha para aplicações multimodais em dispositivos locais (edge).
Benchmarks de Velocidade de Inferência
A velocidade é o grande diferencial. O LFM2.5-2.6B é o modelo mais rápido da sua categoria de tamanho, alcançando quase 15 mil tokens de saída por segundo em alta concorrência, o que equivale a aproximadamente 1,3 bilhão de tokens por dia em uma única H100.
Prototipando agentes localmente, mas alugando modelos na nuvem para as partes mais difíceis? Pague essas assinaturas em dólar com o Bleap sem taxas de câmbio, além de 20% de cashback fixo em Claude, ChatGPT e Gemini. Mastercard autocustodial, sem mensalidade. Peça o cartão Bleap →
5. LFM 2.5 vs. Concorrentes: Comparações Diretas
LFM 2.5 vs. DeepSeek-V4-Flash
DeepSeek-V4-Flash é um modelo de agente robusto e orientado à nuvem. A vantagem do LFM 2.5 é a facilidade de implantação: ele funciona em um celular ou Raspberry Pi sem GPU, enquanto um modelo da classe Flash exige hardware de servidor. Se sua carga de trabalho vive na borda (edge), o LFM 2.5 é a escolha certa.
LFM 2.5 vs. Google Gemma
A Liquid AI faz comparações diretas com as variantes do Gemma 4. Avaliado contra o gemma-4-E2B-it (5,1B) e o gemma-4-E4B-it (8B), entre outros, o LFM2.5-2.6B lidera em todos os benchmarks de seguimento de instruções e em todos os benchmarks de uso de ferramentas, exceto o BFCLv4. O Gemma mantém uma vantagem em programação.
LFM 2.5 vs. Alibaba Qwen
O Qwen 3.5 é o rival mais próximo em termos de capacidade. Em tarefas agênticas, o LFM2.5-2.6B disputa de perto com os modelos Qwen, lidera no AA-Omniscience-Public, fica atrás apenas do Qwen3.5-9B em matemática, e a programação é a única área em que os modelos maiores mantêm vantagem. A eficiência de parâmetros ativos é onde o LFM 2.5 se destaca em custo por token.
A conclusão: o LFM 2.5 entrega precisão competitiva com um consumo de computação drasticamente menor, ocupando um nicho que modelos maiores não conseguem alcançar.
6. Filosofia de Design de IA Agêntica
O LFM 2.5 foi construído pensando em agentes primeiro, e em chat depois.
Uso de Ferramentas e Fluxos de Trabalho Agênticos
Os modelos suportam chamadas de função nativas e planejamento em múltiplas etapas. O design MoE faz toda a diferença aqui: menos parâmetros ativos significam iteração mais rápida nos loops agênticos. O custo zero por token permite paralelismo contínuo de agentes em segundo plano, um padrão que as APIs de nuvem com cobrança por uso simplesmente não conseguem oferecer, o que possibilita paralelizar agentes em massa em hardware local sem custo marginal.
Casos de Uso Agênticos na Prática
Entre as aplicações práticas estão assistentes no dispositivo, triagem offline de documentos com até 128 mil tokens de entrada, extração de dados de formulários e notas fiscais, interpretação de comandos em robótica e agentes em segundo plano que rodam continuamente sem custo por token. Mas é importante ser honesto quanto ao escopo: a própria Liquid AI não recomenda o modelo para codificação agêntica ou tarefas que exigem muito conhecimento acumulado.
7. Capacidades Multimodais: Visão e Áudio
O LFM 2.5 é uma família multimodal, não um modelo apenas de texto.
Modelo de Visão e Linguagem LFM 2.5
O checkpoint de visão lida com imagens, gráficos e documentos junto com texto, e a variante VL de 1,6B foi ajustada para seguir instruções com precisão em dispositivos de borda, o que a torna ideal para fluxos de trabalho móveis com documentos e imagens.
Modelo de Áudio e Linguagem LFM 2.5
O modelo de áudio e linguagem foi lançado como parte da versão de 1,2B, cobrindo compreensão de fala e resposta a perguntas por áudio. Entre as aplicações possíveis estão assistentes de voz, resumo de reuniões e ferramentas de acessibilidade, todas rodando offline para garantir a privacidade.
8. O que Mudou do LFM 2.0 para o LFM 2.5
O salto é significativo. A Liquid AI dobrou o vocabulário para 128K, estendendo o tokenizador em vez de retreiná-lo do zero, para dar melhor suporte a escritas não latinas. O treinamento escalou de forma expressiva, com o MoE de 8B treinado em 38T de tokens, além de RL em larga escala. O LFM 2.5 também trouxe uma janela de contexto de 128K, capacidade de raciocínio e modelos multimodais de Visão e Áudio, algo que não existia na versão 2.0.
9. Licenciamento e Disponibilidade Comercial
O que a Licença Permite
Os modelos são distribuídos sob a licença própria da Liquid. Tanto o modelo base quanto a variante agêntica pós-treinada estão disponíveis no Hugging Face sob a LFM Open License v1.0, que permite uso comercial. Dito isso, o modelo é distribuído sob a licença própria da Liquid, e não uma licença permissiva padrão, então quem tiver planos comerciais deve ler os termos com atenção antes de construir algo sobre ele.
Onde Acessar o LFM 2.5
Você pode baixar os pesos e os model cards no Hugging Face, ou acessar os modelos via OpenRouter e a própria API da Liquid AI para prototipagem rápida.
10. Como Começar e Implantar o LFM 2.5
Início Rápido via API
Crie uma conta na OpenRouter ou na Liquid AI, obtenha uma chave de API, selecione sua variante através do endpoint e envie uma requisição de teste. Esse é o caminho mais rápido para ter um prototype funcionando.
Configuração Local via HuggingFace
Instale sua stack de inferência, baixe os pesos da variante escolhida a partir do model card no Hugging Face e execute a inferência localmente. O suporte já disponível desde o primeiro dia abrange llama.cpp, MLX, vLLM e SGLang, com pesos abertos tanto do modelo base quanto do pós-treinado.
Implantação em Edge
Para Raspberry Pi e dispositivos móveis, use formatos quantizados como GGUF com INT4/INT8. Para o modelo principal MoE em GPU, dimensione a GPU considerando o total de ~8B de parâmetros (≈17 GB em BF16, mais o cache KV), mesmo que apenas ~1B esteja ativo por token, o ideal é uma GPU com pelo menos 24 GB de VRAM.
11. Valor no mundo real: aplicações empresariais e pessoais
Para desenvolvedores individuais e entusiastas
Crie apps de IA offline em hardware comum, sem custo recorrente de API, experimentando livremente pelo Hugging Face.
Para empresas
A implantação privada, on-premises, elimina o risco de compartilhamento de dados, reduz os custos de inferência em comparação com APIs de nível GPT-4 em larga escala, e permite o fine-tuning vertical com dados proprietários.
Para setores de edge e IoT
Controle de qualidade na indústria com o modelo de visão, agentes de robótica e casa inteligente com o 8B-A1B, e suporte a diagnósticos em regiões com conectividade limitada, tudo isso já é possível.
Está lançando um produto de IA mas ainda gastando rios de dinheiro com assinaturas de modelos na nuvem? A Bleap te dá 0% de taxa de câmbio em cobranças em dólar e 20% de cashback fixo em Claude, ChatGPT e Gemini, com um Mastercard self-custodial e sem mensalidade. Peça o cartão Bleap →
Perguntas Frequentes Sobre o LFM 2.5
Quais hardwares o LFM 2.5 exige, e ele realmente roda em um Raspberry Pi?
Sim. As variantes menores rodam em hardware limitado com quantização. O LFM2.5-230M atinge 42 tokens por segundo em um Pi 5, enquanto o agente de 2,6B roda com menos de 2,5 GB de memória, incluindo cerca de 30 tokens por segundo em um celular.
Como o LFM 2.5 se compara ao DeepSeek e ao Qwen com a mesma quantidade de parâmetros?
Comparado ao Qwen, o LFM2.5-2.6B lidera em todos os benchmarks de seguimento de instruções e em quase todos os benchmarks de uso de ferramentas, ficando atrás apenas do Qwen3.5-9B no BFCLv4. Sua eficiência de parâmetros ativos significa um custo computacional muito menor por token do que rivais densos ou modelos de nuvem maiores, como o DeepSeek-V4-Flash.
O LFM 2.5 é gratuito para uso comercial?
Em grande parte, sim. Os pesos estão disponíveis no Hugging Face sob a LFM Open License v1.0, que permite uso comercial, mas você deve ler os termos da licença antes de construir um produto comercial com base nele.
Onde posso baixar ou acessar os modelos LFM 2.5?
No Hugging Face para os pesos, e via OpenRouter ou pela API da Liquid AI para acesso hospedado.
O LFM 2.5 suporta imagem e áudio, ou apenas texto?
Ele é multimodal. O lançamento inclui os modelos Base, Instruct, Japonês, Vision-Language e Audio-Language.
Qual a velocidade de inferência do LFM 2.5 em comparação com modelos de tamanho semelhante?
Muito rápida para sua categoria. O LFM2.5-2.6B chega a quase 15 mil tokens de saída por segundo em alta concorrência, graças à arquitetura baseada em convolução curta e ao roteamento esparso de MoE.
Conclusão: o LFM 2.5 é o modelo de IA de ponta (Edge AI) que você precisa acompanhar?
O LFM 2.5 merece essa atenção: benchmarks competitivos, suporte multimodal nativo e uma arquitetura poderosa o suficiente para agentes corporativos, mas leve o bastante para rodar num Raspberry Pi. Desenvolvedores prototipando agentes, empresas avaliando IA privada e engenheiros de hardware embarcado deveriam dar uma olhada séria agora, seja pelo Hugging Face ou pela API.
E seja qual for a ferramenta de IA que você use junto, pague de forma inteligente. Com a Bleap você não paga taxas de conversão de moeda nas assinaturas em dólar, e no Claude, ChatGPT e Gemini você ganha 20% de cashback em cada renovação, com um Mastercard autocustodial e sem nenhuma assinatura própria.
Um jeito mais inteligente de gastar, enviar, ganhar e negociar









