Qwen 3.8: Especificações, Benchmarks, Preços e Guia Completo (2026)
5 August 2026 · Atualizado 5 August 2026

Gabriel Caetano
ARTIFICIAL INTELIGENCE
Qwen 3.8: Especificações, Benchmarks, Preços e Guia Completo (2026)
Conheça tudo sobre o Qwen 3.8, o modelo de IA open-weight da Alibaba. Veja benchmarks, especificações, preços, APIs, requisitos de hardware e comparações com GPT e Claude.

Tudo Sobre o Qwen 3.8: Especificações, Benchmarks e Tudo o Que Você Precisa Saber
O Qwen 3.8 é um modelo de linguagem ajustado por instrução compacto, com 3,8 bilhões de parâmetros, criado pela equipe Qwen da Alibaba para oferecer um desempenho sólido em raciocínio e programação por uma fração do custo computacional dos modelos de ponta. Ele funciona em GPUs domésticas, é lançado sob uma licença de pesos abertos permissiva e compete com modelos muitas vezes maiores em benchmarks de matemática e código. Ainda assim, 3,8 bilhões de parâmetros é um número pequeno, então o modelo sacrifica um pouco de profundidade em tarefas de documentos longos e que exigem muito conhecimento em troca de velocidade e economia.
Se você passou os últimos dois anos vendo os grandes modelos de linguagem inflarem para centenas de bilhões de parâmetros, o Qwen 3.8 inverte esse jogo. A família Qwen da Alibaba continua encolhendo em tamanho bruto enquanto ganha cada vez mais capacidade, e o Qwen 3.8 é a prova mais clara até agora de que "pequeno" pode ser genuinamente útil. É um modelo compacto, ajustado por instrução, pensado para desenvolvedores que querem raciocínio de qualidade sem precisar de orçamento de data center.
Por que isso importa em 2026? Porque o custo computacional hoje é o fator decisivo para a maioria das equipes, e um modelo que raciocina bem em uma única GPU intermediária muda toda a lógica econômica de lançar funcionalidades de IA. Este guia percorre as especificações, benchmarks, comparações entre versões, requisitos de hardware, formas de implantação, preços e limitações, para você decidir se o Qwen 3.8 tem lugar no seu stack.
Uma observação prática antes de começarmos: seja rodando o Qwen 3.8 localmente ou pagando por uma assinatura de IA hospedada, a forma de pagamento também importa. A maioria dos cartões cobra uma taxa de transação internacional de 2-3% em serviços de IA cobrados em dólar, e é exatamente aí que um cartão com 0% de taxa cambial se destaca.
Paga mensalmente por ChatGPT, Claude ou Gemini? A Bleap cobra 0% de taxa cambial nas suas assinaturas em dólar e ainda dá 20% de cashback fixo em Claude, ChatGPT e Gemini, com um Mastercard self-custodial e sem assinatura própria. (O cashback de 20% vale apenas para Claude, ChatGPT e Gemini.) Peça o cartão Bleap →
1. Qwen 3.8 em resumo: arquitetura, especificações e principais capacidades
Fundamentos da arquitetura do modelo
O Qwen 3.8 é um transformer denso com 3,8 bilhões de parâmetros. Diferente dos designs de mixture-of-experts, que ativam apenas parte da rede a cada consulta, aqui todos os parâmetros são usados em cada passagem, o que mantém o comportamento previsível e simplifica a implantação. O modelo Qwen da Alibaba usa grouped-query attention para reduzir o consumo de memória durante a inferência, embeddings posicionais RoPE para lidar com contextos longos de forma estável, e ativações SwiGLU nas camadas feed-forward.
A janela de contexto suporta até 128.000 posições na configuração estendida, com um tokenizador byte-pair-encoding otimizado tanto para scripts latinos quanto para CJK (chinês, japonês, coreano). O treinamento usa um grande corpus multilíngue com um corte de conhecimento recente, e o modelo é disponibilizado em duas versões: uma variante base para fine-tuning adicional e uma variante ajustada por instrução, alinhada para chat e execução de tarefas. A maioria dos usuários vai preferir a versão ajustada por instrução.
Para que o Qwen 3.8 foi feito
A arquitetura do modelo Qwen é ajustada para quatro tarefas principais: assistência em programação, raciocínio em múltiplas etapas, seguimento de instruções e sumarização. Ele lida nativamente com inglês e chinês, com boa cobertura multilíngue adicional nos principais idiomas europeus e asiáticos.
Além da geração pura de texto, o Qwen 3.8 suporta chamadas de função e uso estruturado de ferramentas, o que o torna um motor viável para agentes leves. Um recurso de destaque é seu modo de raciocínio chain-of-thought, com um alternador de "pensamento estendido" que permite ao modelo dedicar mais poder computacional a problemas difíceis e menos a problemas simples. Para um modelo de 3,8B, esse raciocínio adaptativo é um diferencial e tanto.
2. Resultados do Benchmark Qwen 3.8: O Que os Números Realmente Mostram
Benchmarks Principais de Raciocínio e Linguagem
Em conhecimento geral, a pontuação do benchmark Qwen 3.8 fica bem acima da média típica da classe 3B. O modelo apresenta resultados competitivos em MMLU e MMLU-Pro, superando o desempenho esperado para sua quantidade de parâmetros nos dois casos. É no raciocínio estruturado que o modelo realmente se destaca: tanto o GSM8K, de matemática do ensino fundamental, quanto o MATH, mais difícil, mostram números fortes, e o BBH (Big-Bench Hard), de raciocínio em múltiplas etapas, também se sai bem.
Programação é outro ponto forte. No HumanEval e no LiveCodeBench, o desempenho do Qwen 3.8 rivaliza com modelos na faixa de 7B a 14B, o que é incomum para um modelo tão compacto.
Uma Análise Mais Profunda do Benchmark de Raciocínio do Qwen 3.8
Os números mais interessantes vêm de tarefas de nível competitivo. Em problemas de matemática do AIME e do AMC, os resultados do benchmark de raciocínio do Qwen 3.8, principalmente com o modo de pensamento estendido ativado, são notavelmente fortes para essa classe de tamanho. O GPQA (Graduate-Level Google-Proof Q&A) continua sendo mais difícil, como acontece com qualquer modelo pequeno, mas o Qwen 3.8 ainda assim supera a barreira esperada para sua categoria.
Em rankings da comunidade, como o Open LLM Leaderboard e o LMSYS Chatbot Arena, ele fica constantemente perto ou acima de modelos de três a cinco vezes mais parâmetros. Essa eficiência por parâmetro é basicamente a proposta central do modelo.
Interpretando os Números com Espírito Crítico
Benchmarks pedem cautela. A saturação faz com que os melhores modelos fiquem agrupados perto do teto de pontuação, onde pequenas diferenças deixam de ter relevância, e o risco de contaminação, quando dados de teste vazam para os conjuntos de treinamento, pode inflar os resultados. Também existe uma distância persistente entre as tarefas de benchmark e os prompts confusos do mundo real.
Na prática, encare os números de destaque como um indício, não uma garantia. Para tarefas do dia a dia, como redigir textos, resumir conteúdos e programação de rotina, o Qwen 3.8 tem um desempenho mais próximo da sua força nos benchmarks do que a maioria dos modelos pequenos. Já em raciocínio aberto sob ambiguidade, espere mais variação.
3. Qwen 3.8 vs. Versões Anteriores do Qwen
Qwen 3.8 vs. Qwen 3.7: O Que Mudou?
A comparação entre Qwen 3.8 e Qwen 3.7 é, na maior parte, uma história de refinamento, não de redesign. A contagem de parâmetros permanece próxima, mas o Qwen 3.8 traz dados de treinamento mais limpos, um alinhamento aprimorado usando ajuste de preferências no estilo DPO e uma calibração melhor do seu alternador de raciocínio.
A diferença nos benchmarks é desigual, o que é honesto e esperado. As notas de matemática e programação melhoraram mais, o seguimento de instruções ficou mais preciso, e o conhecimento geral permaneceu praticamente estável, já que um modelo de 3,8B tem espaço limitado para armazenar mais fatos. O throughput também melhorou moderadamente graças a otimizações de atenção, então você obtém uma geração de tokens um pouco mais rápida no mesmo hardware.
Como o Qwen 3.8 Se Encaixa na Família Qwen
O Qwen 3.8 fica na ponta mais eficiente de uma linha ampla que escala até o Qwen 3-14B, Qwen 3-32B e Qwen 3-72B. A relação de troca é simples: o 3,8B oferece velocidade, baixo custo e hospedagem local fácil, enquanto os modelos maiores oferecem conhecimento mais profundo e raciocínio de textos longos mais confiável.
Fique com o 3.8 para cargas de trabalho de alto volume, sensíveis à latência e com foco em custo. Suba para o 14B ou modelos maiores quando a precisão em tarefas complexas com múltiplos documentos for mais importante do que velocidade ou preço.
4. Comparações Diretas: Qwen 3.8 vs. GPT, Claude e Modelos Pequenos Concorrentes
Qwen 3.8 vs. GPT (Camada de Modelos Pequenos da OpenAI)
No confronto Qwen 3.8 vs GPT contra a camada de modelos pequenos da OpenAI, como o GPT-4o Mini, a história é custo versus refinamento. O Qwen 3.8 é competitivo em benchmarks de matemática e programação e pode ser hospedado gratuitamente (self-hosted), enquanto a camada pequena do GPT cobra por token através de uma API fechada. Os modelos GPT geralmente vencem em amplitude de conhecimento geral e confiabilidade de ferramentas prontas para uso. Para empresas, a troca prática é controle e custo contra conveniência e maturidade do ecossistema.
Qwen 3.8 vs. Claude (Camada de Modelos Pequenos da Anthropic)
Na comparação Qwen 3.8 vs Claude contra a camada pequena da Anthropic, como o Claude Haiku, o Claude tende a se destacar em alinhamento de segurança, seguimento cuidadoso de instruções e qualidade de resumo em contextos longos. A vantagem do Qwen 3.8 é a flexibilidade de implantação: você pode rodar os pesos abertos no seu próprio hardware, sem taxa por chamada e sem que os dados saiam do seu ambiente. O Claude é apenas um serviço hospedado, então requisitos de licenciamento e privacidade costumam decidir essa disputa.
Qwen 3.8 vs. Kimi K3 e Outros Modelos Abertos Concorrentes
Em qualquer comparação de LLM open source, o Qwen 3.8 se sai bem contra o Kimi K3 e outros modelos abertos na faixa de 3B a 7B. Ele costuma vencer em programação, matemática e cobertura multilíngue. Onde ele fica atrás é na síntese de contextos muito longos e na profundidade dos ecossistemas de fine-tuning de nicho, nos quais o Llama e o Mistral ainda têm uma comunidade mais consolidada. Se sua carga de trabalho é pesada em código e raciocínio, o Qwen 3.8 é uma ótima escolha padrão entre os modelos abertos.
Cansado dos custos de API por token para modelos de linguagem pequenos? Com o Bleap, você hospeda modelos abertos como o Qwen 3.8 sem taxas por chamada e com total privacidade dos dados. Peça o cartão Bleap →
5. Requisitos de Hardware do Qwen 3.8: O Que Você Precisa para Rodar Localmente
Requisitos Mínimos de VRAM
Os requisitos de VRAM do Qwen 3.8 são surpreendentemente modestos. Em precisão total FP16, espere precisar de aproximadamente 8 a 10 GB de VRAM, algo que uma placa como a RTX 4080 aguenta sem problemas. A quantização INT8 reduz esse piso para cerca de 5 a 6 GB, com apenas uma pequena perda de qualidade, colocando a RTX 3060 12 GB dentro do alcance.
Para quantização INT4 ou GGUF, a demanda de VRAM cai para aproximadamente 3 a 4 GB, e a inferência apenas em CPU se torna genuinamente viável para cargas de trabalho mais leves. GPUs em nuvem como a A10G dão bastante margem para processamento em lote.
Hardware Recomendado para Inferência Local Sem Travamentos
Para geração de tokens rápida e fluida, uma única GPU de consumo com 12 GB é o ponto ideal para a maioria dos requisitos de hardware do Qwen 3.8. Você vai querer pelo menos 16 GB de RAM no sistema e armazenamento NVMe, já que o arquivo de pesos em FP16 tem cerca de 7 a 8 GB e as versões quantizadas são menores.
Uma alternativa apenas com CPU via llama.cpp funciona, mas espere algo na faixa de tokens por segundo de um dígito em hardware de desktop comum. No Mac com Apple Silicon, o backend MPS executa o Qwen 3.8 bem, e a memória unificada faz com que uma máquina da linha M com 16 GB ou mais lide com ele sem dificuldades.
Checklist de Planejamento de Hardware para LLM Auto-Hospedado
Ao planejar o hardware para um LLM auto-hospedado, siga este checklist:
- VRAM da GPU: 4 GB no mínimo (INT4), 8 a 10 GB recomendado (FP16)
- RAM do sistema: 16 GB ou mais
- Armazenamento: SSD NVMe com 20 GB livres para os pesos e cache
- Refrigeração e energia: temperaturas estáveis para inferência contínua
- Expectativas de desempenho: aproximadamente 40 a 80 tokens por segundo em uma GPU intermediária, um dígito apenas em CPU
- Custo de operação: uma GPU intermediária consome cerca de 150 a 250 watts em uso intenso, então a inferência local contínua é barata em comparação com a cobrança por token das APIs
6. Como Acessar o Qwen 3.8: Nuvem, API e Rotas de Implantação Local
Acesso Baseado em Nuvem via Alibaba Cloud (Model Studio)
A rota mais direta para acessar a API do Qwen 3.8 é o Model Studio da Alibaba Cloud. Crie uma conta, verifique-a e depois navegue até o endpoint do modelo Qwen para gerar uma chave de API. O Model Studio oferece cotas no nível gratuito e créditos de teste para avaliação, com limites de taxa publicados por chave. Uma facilidade é que o endpoint é compatível com OpenAI, então a maioria dos SDKs existentes funciona só trocando a URL base.
Acesso à API do Qwen 3.8 via Provedores Terceirizados
Se você preferir não usar a própria nuvem da Alibaba, vários provedores terceirizados hospedam modelos Qwen, incluindo Together AI, Fireworks AI, Groq e OpenRouter. A latência e os preços variam, sendo que a Groq costuma liderar em velocidade bruta e o OpenRouter é útil para rotear entre provedores. Escolha uma API de terceiros quando quiser um único relacionamento de cobrança ou menor latência em uma região específica, e o endpoint da Alibaba quando quiser a implementação de referência.
Guia de Implantação Local do Qwen 3.8
Para a implantação local do Qwen 3.8, você tem quatro caminhos fáceis. Baixe os pesos do Hugging Face Hub e carregue-os com a biblioteca transformers para ter controle total. Para uma configuração com um único comando, o Ollama baixa e executa o modelo instantaneamente. Usuários não técnicos podem usar a interface gráfica do LM Studio para baixar e conversar com o modelo em minutos. Para builds quantizados em hardware mais modesto, obtenha um arquivo GGUF e execute-o através do llama.cpp.
7. Preços e Planos de Assinatura Explicados
O Alibaba Cloud Model Studio cobra o Qwen 3.8 por token, com taxas separadas para entrada e saída que ficam bem abaixo dos preços dos modelos de ponta, considerando o tamanho reduzido do modelo. Um plano gratuito com créditos de teste permite experimentar antes de se comprometer.
A decisão mais importante é escolher entre hospedar você mesmo ou usar a API. Rodar o Qwen 3.8 localmente tem custo marginal praticamente zero por requisição depois que o hardware está pago, então cargas de trabalho de alto volume favorecem a autogestão. Provedores terceirizados como Together AI e Fireworks AI oferecem taxas por token competitivas que fazem sentido para uso esporádico ou de baixo volume, quando você prefere não manter infraestrutura própria. Como regra geral: se você atende tráfego constante e pesado, invista na GPU; se o uso é ocasional ou imprevisível, pague por token.
Se você assina ferramentas de IA hospedadas cobradas em dólar, lembre-se do custo escondido que a maioria das pessoas não percebe: um cartão comum adiciona de 2% a 3% em cada cobrança em moeda estrangeira. Com o Bleap, você paga em dólar na taxa real, com 0% de taxas de câmbio, então seu gasto mensal com IA não infla silenciosamente.
8. Status de Código Aberto e Disponibilidade
O Qwen 3.8 é distribuído sob uma licença de pesos abertos permissiva que autoriza uso comercial, um dos principais motivos pelos quais as empresas levam o modelo a sério. Você pode baixar os pesos no Hugging Face Hub, através do model card oficial, e no ModelScope para usuários na China.
A atividade da comunidade é saudável, com projetos de fine-tuning ativos, uma coleção crescente de quantizações feitas pela comunidade e um público de desenvolvedores engajado compartilhando receitas e adaptadores. A Alibaba tem sido relativamente transparente sobre o ritmo de lançamentos, o que reduz as incertezas em relação às próximas versões.
Em qualquer comparação de LLMs open source, o modelo de pesos abertos é o diferencial mais marcante. Ele elimina a dependência de fornecedor, permite auditar e hospedar o modelo você mesmo, e mantém dados sensíveis dentro do seu próprio ambiente, exatamente por isso o desempenho de LLMs pequenos em 2026 se tornou um espaço tão competitivo.
Está rodando IA no seu próprio hardware para economizar? Faça o mesmo com suas assinaturas. O Bleap oferece 0% de taxa de câmbio em ferramentas de IA cobradas em dólar, além de 20% de cashback fixo em Claude, ChatGPT e Gemini, sem nenhuma mensalidade própria. Peça o cartão Bleap →
9. Limitações e Ressalvas Conhecidas Antes de Você Trocar
Limites de Desempenho
Três bilhões e oitocentos milhões de parâmetros é realmente pouco, e isso fica evidente nas tarefas mais difíceis. Sínteses complexas envolvendo múltiplos documentos e cadeias agentivas longas revelam esse limite, situações em que modelos maiores raciocinam com mais consistência. As taxas de alucinação também aumentam em consultas que exigem muito conhecimento, na comparação com modelos maiores, e a qualidade cai para idiomas de baixo recurso fora do conjunto multilíngue principal. O ideal é escolher o modelo de acordo com a tarefa, em vez de esperar um comportamento de ponta.
Lacunas no Ecossistema e nas Ferramentas
A comunidade de fine-tuning em torno do Qwen está crescendo rápido, mas ainda é menor do que os ecossistemas do Llama e do Mistral, então você pode encontrar menos adaptadores e receitas prontas para uso. A confiabilidade do tool-calling, embora sólida, pode ser inconsistente nas primeiras versões de qualquer lançamento. A documentação é razoável, mas não tão profunda quanto a que a OpenAI e a Anthropic oferecem para seus modelos hospedados.
Considerações sobre Conformidade e Privacidade
Usar os endpoints da Alibaba Cloud traz questões sobre residência de dados que setores regulados precisam avaliar com cuidado, além de exigências de trilha de auditoria e registro de logs. A grande vantagem aqui são os pesos abertos: uma implantação self-hosted mantém todos os dados dentro da sua própria infraestrutura e elimina completamente o risco de privacidade na nuvem. Para cargas de trabalho sensíveis, esse costuma ser o fator decisivo a favor do Qwen 3.8.
10. Quem deve (e quem não deve) usar o Qwen 3.8 agora
Usuários ideais
- Desenvolvedores que criam recursos de IA leves com orçamento de computação limitado
- Pesquisadores que precisam de um modelo de peso aberto capaz para experimentos de fine-tuning
- Empresas na região APAC que já operam na infraestrutura da Alibaba Cloud
- Entusiastas e curiosos que executam LLMs localmente em GPUs de consumo
Usuários que devem procurar outras opções
- Equipes que precisam de precisão de altíssimo nível em tarefas com documentos longos, para as quais um modelo classe 72B se encaixa melhor
- Organizações que exigem provedores de API certificados em SOC 2 ou HIPAA prontos para uso
- Desenvolvedores fortemente investidos nos ecossistemas de fine-tuning do Llama ou Mistral
Resumindo: escolha o Qwen 3.8 quando velocidade, custo e hospedagem própria forem as prioridades, e opte por outra alternativa (ou suba de nível) quando a precisão em tarefas difíceis e de alto risco for inegociável.
Perguntas Frequentes Sobre o Qwen 3.8
Quais são os requisitos de hardware do Qwen 3.8 para rodar localmente?
Em precisão total FP16, considere algo entre 8 e 10 GB de VRAM. Com quantização INT4 ou GGUF, esse número cai para cerca de 3 a 4 GB, tornando viável a inferência apenas em CPU para tarefas mais leves. Veja a Seção 5 para o detalhamento completo.
Como o Qwen 3.8 se compara ao GPT-4o Mini e ao Claude Haiku?
O Qwen 3.8 é competitivo em benchmarks de matemática e programação e pode ser hospedado por conta própria de graça. GPT-4o Mini e Claude Haiku costumam se destacar em conhecimento geral, refinamento de segurança e confiabilidade no uso de ferramentas, mas cobram por token através de APIs fechadas. Todos os detalhes estão na Seção 4.
O Qwen 3.8 é totalmente open source e gratuito para uso comercial?
Sim. O Qwen 3.8 é distribuído sob uma licença de pesos abertos permissiva, que autoriza o uso comercial. Você pode baixar os pesos pelo Hugging Face Hub, através do model card oficial, ou pelo ModelScope.
Em quais benchmarks o Qwen 3.8 tem o melhor desempenho?
Programação e matemática são suas categorias de destaque. Ele registra pontuações fortes em HumanEval e LiveCodeBench para código, além de resultados impressionantes em GSM8K e MATH, muitas vezes rivalizando com modelos com várias vezes mais parâmetros.
Qual é a diferença entre o Qwen 3.8 e o Qwen 3.7?
O Qwen 3.8 refina em vez de reinventar. Ele traz dados de treinamento mais limpos, alinhamento de preferências melhorado e calibração de raciocínio mais precisa, com os maiores avanços em matemática e programação. O conhecimento geral permanece praticamente estável. Veja a Seção 3.
Como faço para acessar a API do Qwen 3.8?
O caminho mais simples é o Alibaba Cloud Model Studio, que oferece um endpoint compatível com OpenAI e um plano gratuito com créditos de teste. Provedores terceirizados como Together AI, Fireworks AI, Groq e OpenRouter também o hospedam. Veja a Seção 6.
Conclusão: o Qwen 3.8 merece sua atenção em 2026?
O Qwen 3.8 entrega desempenho competitivo em raciocínio e programação com apenas 3,8 bilhões de parâmetros, e é justamente isso que o torna interessante. Suas vitórias de destaque em benchmarks de matemática e código, somadas a uma licença de pesos abertos e facilidade de hospedagem local, o colocam entre os melhores da categoria de LLMs pequenos em 2026.
As limitações são reais e merecem atenção: o teto de tamanho aparece em trabalhos complexos com documentos longos, e o ecossistema de fine-tuning ainda está amadurecendo se comparado ao Llama e ao Mistral. Ainda assim, fica claro para quais casos ele é indicado. Escolha o Qwen 3.8 para cargas de trabalho sensíveis a custo, de alto volume e auto-hospedadas, e opte por um modelo maior quando a precisão em tarefas difíceis for mais importante que velocidade e preço. Considerando o ritmo constante de lançamentos da Alibaba, novas melhorias parecem estar a caminho.
Seja qual for o caminho escolhido, criar uma instância local ou assinar um modelo hospedado, pague de forma inteligente. Com o Bleap, você não paga taxas de câmbio em assinaturas em dólar, e no Claude, ChatGPT e Gemini você ganha 20% de cashback fixo em cada renovação. Peça o cartão Bleap →
Um jeito mais inteligente de gastar, enviar, ganhar e negociar

- Artificial Inteligence








