Blogs

LFM 2.5: Arquitetura, Benchmarks e Porque Importa para Edge AI

13 August 2026  ·  Atualizado 14 August 2026

Gabriel Caetano

Gabriel Caetano

LFM 2.5: Arquitetura, Benchmarks e Porque Importa para Edge AI

O LFM 2.5 é a nova família de modelos edge da Liquid AI, criada para IA rápida, privada e executada localmente. Funciona em telemóveis, portáteis e Raspberry Pi, com forte desempenho em raciocínio, ferramentas e multimodalidade.

lfm-2-5-architecture-benchmarks-edge-ai

Tudo Sobre a Nova LFM 2.5: Arquitetura, Benchmarks e Porque É Importante para a IA de Edge

Correr IA capaz sem uma fatura de cloud já não é uma fantasia. A LFM 2.5 é a mais recente família de modelos de fundação on-device da Liquid AI, e o seu agente principal, LFM2.5-2.6B, cabe em menos de 2,5 GB de memória, corre a cerca de 30 tokens por segundo em hardware de nível de telemóvel, e supera ou iguala modelos várias vezes maiores em benchmarks selecionados. Isto torna a IA privada e offline genuinamente prática. Vale a pena notar que os números de destaque são benchmarks próprios da Liquid AI, portanto devem ser encarados como afirmações até que testes independentes os confirmem.

Este guia explica o que é a LFM 2.5, como funciona a sua arquitetura, como as variantes se comparam com a Gemma, Qwen e DeepSeek, e como implementá-la. Se também recorre a subscrições de IA na cloud como o Claude, o ChatGPT ou o Gemini para tarefas mais pesadas, existe uma forma mais inteligente de pagar por essas também, que vamos abordar ao longo do artigo.

Está a criar agentes localmente mas continua a pagar por IA na cloud à parte? A Bleap cobra 0% de taxas de câmbio nas suas subscrições em USD e oferece 20% de cashback fixo nas renovações do Claude, ChatGPT e Gemini, sem qualquer subscrição própria. (O cashback de 20% aplica-se apenas a estas três ferramentas.) Obter o cartão Bleap →

1. O Que É o LFM 2.5? Visão Geral e Arquitetura

O LFM 2.5 é a mais recente geração de Liquid Foundation Models, desenvolvida pela Liquid AI, uma empresa fundada por antigos cientistas informáticos do MIT. Esta família tem um único objetivo: inteligência poderosa que corre no dispositivo à sua frente, e não num data center.

A inovação central é uma arquitetura híbrida. O LFM2.5-2.6B é um modelo com 2,69 mil milhões de parâmetros e 30 camadas (22 blocos de convolução curta com dupla porta e 8 camadas GQA), um vocabulário de 128K e uma janela de contexto de 131.072 tokens. Ao substituir a maioria das camadas de atenção por convoluções curtas, consegue-se reduzir o uso de memória e acelerar a inferência em CPUs comuns.

Como Funciona o Design Mixture of Experts

O modelo mais eficiente da linha acrescenta a esta arquitetura um design Mixture of Experts (MoE). O LFM2.5-8B-A1B utiliza um design MoE esparso que ativa 1,5 mil milhões dos 8,3 mil milhões de parâmetros totais por cada passagem, mantendo baixo o custo de computação por token gerado. Cada camada MoE tem 32 especialistas e seleciona os top-k=4 especialistas por token, através de um router sigmoide normalizado e de vieses de encaminhamento adaptativos para equilíbrio de carga. O resultado é uma qualidade equivalente a um modelo da classe 4B, mas com um custo de decodificação próximo do de um modelo de 1,5B, algo que os modelos transformer tradicionais não conseguem igualar em hardware limitado.

2. Variantes e Tamanhos do Modelo LFM 2.5

O LFM 2.5 não é um único modelo, mas sim um leque de tamanhos e especializações.

LFM2.5-230M

O checkpoint mais pequeno. A Liquid AI mostra o LFM2.5-230M a obter uma pontuação de 43.26 no benchmark de utilização de ferramentas BFCLv3, superando o Granite 4.0-350M da IBM (39.58) e ultrapassando modelos maiores de 1 mil milhão de parâmetros, como o Gemma 3 1B IT da Google (16.61). Foi concebido para chamadas de ferramentas estruturadas e extração de dados.

Família LFM2.5-1.2B

Este é um lançamento abrangente com modelos Base, Instruct, Japonês, Visão-Linguagem e Áudio-Linguagem. A Liquid AI aumentou o pré-treino de 10 biliões para 28 biliões de tokens e reforçou o pós-treino com aprendizagem por reforço.

LFM2.5-2.6B

O agente de uso geral, pronto para telemóveis. Planeia, chama ferramentas e executa tarefas em várias etapas em telemóveis, portáteis, PCs e robôs.

LFM2.5-8B-A1B (MoE)

O modelo principal de raciocínio. Ao contrário do seu antecessor, o LFM2.5-8B-A1B é um modelo exclusivamente de raciocínio, que produz uma cadeia de pensamento explícita antes de chegar à resposta final.

Variante

Parâmetros totais

Parâmetros ativos

Utilização principal

Melhor hardware

LFM2.5-230M

230M

230M

Chamadas de ferramentas, extração

Telemóvel, Raspberry Pi

LFM2.5-1.2B

1.2B

1.2B

Multimodal, multilingue

Telemóvel, portátil

LFM2.5-2.6B

2.69B

2.69B

Agentes no dispositivo

Portátil, telemóvel

LFM2.5-8B-A1B

8.3B

1.5B

Raciocínio, ciclos agênticos

GPU única de 24GB ou CPU

3. Capacidades de IA em Dispositivo e Edge

Todo o propósito do LFM 2.5 é funcionar sem depender da cloud ou de uma GPU.

Executar o LFM 2.5 num Raspberry Pi e em Hardware Móvel

Os números são o indicador prático. O LFM2.5-230M corre a 213 tokens por segundo num Galaxy S25 Ultra e a 42 tokens por segundo num Pi 5. No caso do agente maior, a Liquid AI mediu 220 tokens por segundo em decodificação num Apple M5 Max, 113 tokens por segundo num AMD Ryzen AI Max+ 395 e cerca de 30 tokens por segundo num telemóvel, tudo isto com menos de 2,5 GB de memória.

Vantagens de Privacidade e IA Offline

Como a inferência permanece local, os dados nunca saem do dispositivo e o custo marginal de cada execução é praticamente nulo. Isto é importante para cargas de trabalho na saúde, no setor jurídico e financeiro, em ambientes isolados (air-gapped) e em qualquer situação em que a fatura de uma API na cloud disparasse à escala.

4. Benchmarks e Resultados de Desempenho do LFM 2.5

A Liquid AI compara o seu modelo com as variantes Gemma 4 e Qwen 3.5, usando o seu próprio conjunto de testes de avaliação.

Benchmarks de Texto e Raciocínio

No caso do modelo de raciocínio, os ganhos em relação ao antecessor são significativos. O LFM2.5-8B-A1B melhora em todas as frentes: a Taxa de Não-Alucinação AA-Omniscience subiu de 7,46 para 63,47 e o IFEval aumentou de 79,44 para 91,84.

Benchmarks de Matemática e Tarefas Agênticas

O MATH500 subiu de 74,80 para 88,76 e o Tau² Telecom passou de 13,60 para 88,07. No caso do agente mais pequeno, o LFM2.5-2.6B lidera em todos os benchmarks de seguimento de instruções e em quase todos os benchmarks de utilização de ferramentas, ficando atrás apenas do Qwen3.5-9B no BFCLv4, e supera ambos os modelos Gemma em todas as tarefas agênticas.

Benchmarks de Visão e Áudio

Os checkpoints multimodais mantêm um bom desempenho. O LFM2.5-VL-1.6B apresenta um desempenho superior no seguimento de instruções, tanto nos benchmarks de visão como nos de texto, tornando-o uma boa escolha para aplicações multimodais em dispositivos locais (on-edge).

Benchmarks de Velocidade de Inferência

A velocidade é o ponto forte. O LFM2.5-2.6B é o modelo mais rápido da sua categoria de tamanho, atingindo quase 15 mil tokens de saída por segundo com elevada concorrência, ou seja, cerca de 1,3 mil milhões de tokens por dia num único H100.

Estás a prototipar agentes localmente, mas alugas modelos na cloud para as partes mais difíceis? Paga essas subscrições em USD com o Bleap sem taxas de câmbio, e ainda recebes 20% de cashback fixo em Claude, ChatGPT e Gemini. Cartão Mastercard self-custodial, sem mensalidade. Pede já o cartão Bleap →

5. LFM 2.5 vs. Concorrentes: Comparações Diretas

LFM 2.5 vs. DeepSeek-V4-Flash

O DeepSeek-V4-Flash é um modelo de agente sólido e orientado para a cloud. A vantagem do LFM 2.5 está na facilidade de implementação: funciona num telemóvel ou num Raspberry Pi sem GPU, enquanto um modelo da classe Flash exige hardware de servidor. Se a sua carga de trabalho vive na periferia (edge), o LFM 2.5 é claramente a opção certa.

LFM 2.5 vs. Google Gemma

A Liquid AI faz uma comparação direta com as variantes do Gemma 4. Avaliado face ao gemma-4-E2B-it (5,1B) e ao gemma-4-E4B-it (8B), entre outros, o LFM2.5-2.6B lidera em todos os benchmarks de seguimento de instruções e em todos os benchmarks de utilização de ferramentas, exceto no BFCLv4. O Gemma mantém uma vantagem na programação.

LFM 2.5 vs. Alibaba Qwen

O Qwen 3.5 é o rival mais próximo em termos de capacidade. Em tarefas agênticas, o LFM2.5-2.6B compete de perto com os modelos Qwen, lidera no AA-Omniscience-Public e fica apenas atrás do Qwen3.5-9B em matemática, sendo a programação a única área onde os modelos maiores mantêm vantagem. É na eficiência de parâmetros ativos que o LFM 2.5 se destaca em termos de custo por token.

A conclusão: o LFM 2.5 oferece uma precisão competitiva com um custo computacional drasticamente inferior, ocupando um nicho que os modelos maiores não conseguem alcançar.

6. Filosofia de Design de IA Agêntica

O LFM 2.5 foi construído a pensar primeiro em agentes, e só depois em chat.

Uso de Ferramentas e Fluxos de Trabalho Agênticos

Os modelos suportam function calling nativo e planeamento em múltiplas etapas. O design MoE é importante aqui: menos parâmetros ativos significam iterações mais rápidas nos ciclos agênticos. O custo zero por token permite paralelismo contínuo de agentes em segundo plano, um padrão que as APIs cloud com tarifação por uso impedem estruturalmente, o que significa que os agentes podem ser massivamente paralelizados em hardware local sem qualquer custo marginal.

Casos de Uso Agênticos Práticos

Entre as implementações práticas incluem-se assistentes no dispositivo, triagem offline de documentos com inputs até 128K, extração de formulários e faturas, interpretação de comandos para robótica, e agentes em segundo plano que funcionam continuamente sem custo por token. No entanto, é importante ser honesto quanto ao âmbito: a Liquid AI não recomenda explicitamente este modelo para programação agêntica ou tarefas que exijam muito conhecimento.

7. Capacidades Multimodais: Visão e Áudio

O LFM 2.5 é uma família multimodal, não um modelo apenas de texto.

Modelo de Visão e Linguagem LFM 2.5

O checkpoint de visão processa imagens, gráficos e documentos em conjunto com texto, e a variante VL de 1,6B está otimizada para um forte seguimento de instruções em dispositivos edge, o que é adequado para fluxos de trabalho móveis de documentos e imagens.

Modelo de Áudio e Linguagem LFM 2.5

O modelo de áudio e linguagem foi lançado como parte da versão de 1,2B, abrindo a compreensão de fala e resposta a perguntas em áudio. As aplicações potenciais incluem assistentes de voz, resumo de reuniões e ferramentas de acessibilidade, tudo a funcionar offline para garantir a privacidade.

8. O que mudou da LFM 2.0 para a LFM 2.5

O salto é substancial. A Liquid AI duplicou o vocabulário para 128K, ampliando o tokenizador em vez de o treinar novamente do zero, para suportar melhor scripts não latinos. O treino aumentou drasticamente, com o MoE de 8B treinado em 38T tokens, além de RL em grande escala. A LFM 2.5 também acrescentou uma janela de contexto de 128K, capacidades de raciocínio e modelos multimodais de Visão e Áudio inexistentes na versão 2.0.

9. Licenciamento e disponibilidade comercial

O que a licença permite

Os modelos são disponibilizados sob a licença própria da Liquid. O modelo base e a variante agentic pós-treinada estão ambos no Hugging Face sob a LFM Open License v1.0, que permite uso comercial. No entanto, o modelo é distribuído sob a licença própria da Liquid e não sob uma licença permissiva padrão, por isso quem tiver planos comerciais deve ler os termos com atenção antes de o utilizar.

Onde aceder à LFM 2.5

Pode fazer download dos pesos e das fichas de modelo (model cards) através do Hugging Face, ou aceder aos modelos através do OpenRouter e da própria API da Liquid AI para prototipagem rápida.

10. Como começar e implementar a LFM 2.5

Início rápido via API

Crie uma conta no OpenRouter ou na Liquid AI, obtenha uma chave de API, selecione a variante através do endpoint e envie um pedido de teste. Este é o caminho mais rápido para ter um prototípo a funcionar.

Configuração local via HuggingFace

Instale a sua stack de inferência, faça download dos pesos da variante escolhida a partir da model card no Hugging Face e execute a inferência localmente. O suporte disponível desde o primeiro dia abrange llama.cpp, MLX, vLLM e SGLang, com pesos base e pós-treinados em aberto.

Implementação em edge

Para Raspberry Pi e dispositivos móveis, use formatos quantizados como o GGUF com INT4/INT8. Para o modelo principal MoE em GPU, dimensione a GPU para os cerca de 8B de pesos completos (≈17 GB em BF16, mais a cache KV), mesmo que apenas ~1B esteja ativo por token, visando uma GPU com pelo menos 24 GB de VRAM.

11. Valor no Mundo Real: Aplicações Empresariais e Pessoais

Para Programadores Individuais e Entusiastas

Crie aplicações de IA offline em hardware de consumo sem custos recorrentes de API, experimentando livremente através do Hugging Face.

Para Empresas

A implementação privada, no local, elimina o risco de partilha de dados, reduz os custos de inferência em comparação com APIs da classe GPT-4 em grande escala, e permite o ajuste fino vertical com dados proprietários.

Para Indústrias Edge e IoT

O controlo de qualidade na indústria com o modelo de visão, agentes de casa inteligente e robótica com o 8B-A1B, e o apoio ao diagnóstico em regiões com conectividade limitada estão todos ao alcance.

Está a lançar um produto de IA mas continua a gastar dinheiro em subscrições de modelos na cloud? A Bleap oferece-lhe 0% de comissões cambiais na faturação em USD e 20% de cashback fixo em Claude, ChatGPT e Gemini, com um Mastercard self-custodial e sem subscrição mensal. Obtenha o cartão Bleap →

Perguntas Frequentes sobre o LFM 2.5

Que hardware é que o LFM 2.5 exige, e será que corre mesmo num Raspberry Pi?

Sim. As variantes mais pequenas correm em hardware limitado com quantização. O LFM2.5-230M atinge 42 tokens por segundo num Pi 5, enquanto o agente 2.6B corre com menos de 2,5 GB de memória, incluindo cerca de 30 tokens por segundo num telemóvel.

Como é que o LFM 2.5 se compara ao DeepSeek e ao Qwen com o mesmo número de parâmetros?

Face ao Qwen, o LFM2.5-2.6B lidera em todos os benchmarks de seguimento de instruções e em quase todos os benchmarks de utilização de ferramentas, ficando apenas atrás do Qwen3.5-9B no BFCLv4. A sua eficiência em parâmetros ativos traduz-se num consumo computacional por token muito inferior ao de rivais densos ou de modelos cloud maiores, como o DeepSeek-V4-Flash.

O LFM 2.5 é gratuito para uso comercial?

Em grande parte, sim. Os pesos estão disponíveis no Hugging Face sob a LFM Open License v1.0, que permite uso comercial, mas vale a pena ler os termos da licença antes de construir um produto comercial com base nele.

Onde posso descarregar ou aceder aos modelos LFM 2.5?

No Hugging Face para obter os pesos, e através do OpenRouter ou da API da Liquid AI para acesso alojado.

O LFM 2.5 suporta imagem e áudio, ou apenas texto?

É multimodal. O lançamento inclui modelos Base, Instruct, Japonês, Vision-Language e Audio-Language.

Qual é a velocidade de inferência do LFM 2.5 em comparação com modelos de tamanho semelhante?

É muito rápido para a sua categoria. O LFM2.5-2.6B atinge quase 15 mil tokens de saída por segundo em condições de elevada concorrência, graças à arquitetura de convolução curta e ao encaminhamento MoE esparso.

Conclusão: A LFM 2.5 é o modelo de IA de ponta a seguir?

A LFM 2.5 merece atenção: benchmarks competitivos, suporte multimodal nativo e uma arquitetura potente o suficiente para agentes empresariais, mas leve o suficiente para correr num Raspberry Pi. Programadores a prototipar agentes, empresas a avaliar IA privada e engenheiros de hardware de ponta deviam todos dar-lhe uma vista de olhos séria já, começando pelo Hugging Face ou pela API.

E sejam quais forem as ferramentas de IA que uses ao lado dela, paga de forma inteligente. Com o Bleap evitas as comissões cambiais nas subscrições em USD, e no Claude, ChatGPT e Gemini ganhas 20% de cashback em cada renovação, com um Mastercard autocustodiado e sem qualquer subscrição própria.

Uma forma mais inteligente de gastar, enviar, ganhar e negociar

Imagem da seção Principais Conclusões

Artigos relacionados