Qwen 3.8: Especificações, Benchmarks, Preços e Guia Completo (2026)
5 August 2026 · Atualizado 5 August 2026

Gabriel Caetano
ARTIFICIAL INTELIGENCE
Qwen 3.8: Especificações, Benchmarks, Preços e Guia Completo (2026)
Descubra tudo sobre o Qwen 3.8, o modelo de IA open-weight compacto da Alibaba. Compare benchmarks, especificações, preços, requisitos de hardware, APIs e alternativas em 2026.

Tudo sobre o Qwen 3.8: Especificações, Benchmarks e Tudo o que Precisa de Saber
O Qwen 3.8 é um modelo de linguagem ajustado por instruções compacto, com 3,8 mil milhões de parâmetros, criado pela equipa Qwen da Alibaba, pensado para oferecer um desempenho sólido em raciocínio e programação a uma fração do custo computacional dos modelos de topo. Funciona em GPUs de consumo, é distribuído com uma licença de pesos abertos permissiva e compete com modelos várias vezes maiores nos benchmarks de matemática e código. Dito isto, 3,8 mil milhões de parâmetros continua a ser pouco, pelo que perde alguma profundidade em tarefas de documentos longos e com muito conhecimento em troca de velocidade e economia.
Se passou os últimos dois anos a ver os modelos de linguagem grandes a inchar para centenas de milhares de milhões de parâmetros, o Qwen 3.8 vem inverter essa lógica. A família Qwen da Alibaba continua a encolher em tamanho bruto enquanto sobe em capacidade, e o Qwen 3.8 é a prova mais clara até agora de que "pequeno" pode ser genuinamente útil. É um modelo compacto, ajustado por instruções, pensado para programadores que querem um raciocínio competente sem precisar de um orçamento de data center.
Porque é que isto importa em 2026? Porque o custo computacional é agora o fator decisivo para a maioria das equipas, e um modelo que raciocina bem numa única GPU de gama média muda por completo a economia do lançamento de funcionalidades de IA. Este guia percorre as especificações, benchmarks, comparações entre versões, requisitos de hardware, formas de implementação, preços e limitações, para que possa decidir se o Qwen 3.8 tem lugar na sua stack.
Uma nota prática antes de começarmos: quer utilizes o Qwen 3.8 localmente, quer pagues uma subscrição de IA alojada, a forma de pagamento também é importante. A maioria dos cartões cobra uma comissão de 2-3% em transações no estrangeiro nos serviços de IA faturados em USD, e é precisamente aí que um cartão com 0% de comissões cambiais faz toda a diferença.
Pagas o ChatGPT, o Claude ou o Gemini todos os meses? O Bleap não cobra qualquer comissão cambial nas tuas subscrições em USD e dá-te 20% de cashback fixo no Claude, ChatGPT e Gemini, com um cartão Mastercard self-custodial e sem qualquer subscrição própria. (O cashback de 20% aplica-se apenas ao Claude, ChatGPT e Gemini.) Obtém o cartão Bleap →
1. Qwen 3.8 num Ápice: Arquitetura, Especificações e Principais Capacidades
Fundamentos da Arquitetura do Modelo
O Qwen 3.8 é um transformer denso com 3,8 mil milhões de parâmetros. Ao contrário dos designs de mixture-of-experts, que ativam apenas parte da rede por cada pedido, aqui todos os parâmetros são usados em cada passagem, o que mantém o comportamento previsível e simplifica a implementação. Este modelo da Alibaba Qwen usa grouped-query attention para reduzir a sobrecarga de memória durante a inferência, embeddings posicionais RoPE para uma gestão estável de contextos longos, e ativações SwiGLU nas camadas feed-forward.
A janela de contexto suporta até 128.000 posições na configuração alargada, com um tokenizer byte-pair-encoding otimizado tanto para scripts latinos como CJK. O treino baseia-se num grande corpus multilingue com um corte de conhecimento recente, e o modelo é lançado em duas versões: uma variante base para ajuste fino adicional e uma variante ajustada por instruções, alinhada para conversação e cumprimento de tarefas. A maioria dos utilizadores vai preferir a versão ajustada por instruções.
Para Que Foi Construído o Qwen 3.8
A arquitetura do modelo Qwen está otimizada para quatro tarefas principais: assistência de programação, raciocínio em várias etapas, cumprimento de instruções e resumo de texto. Lida nativamente com inglês e chinês, com uma cobertura multilingue adicional sólida nas principais línguas europeias e asiáticas.
Além da geração de texto simples, o Qwen 3.8 suporta chamadas de funções e utilização estruturada de ferramentas, o que o torna um motor viável para agentes leves. Uma funcionalidade notável é o seu modo de raciocínio chain-of-thought, com um interruptor de "pensamento alargado" que permite ao modelo dedicar mais capacidade de computação a problemas difíceis e menos a problemas simples. Para um modelo de 3,8B, esse raciocínio adaptativo é uma diferenciação significativa.
2. Resultados dos Benchmarks do Qwen 3.8: O Que os Números Realmente Mostram
Benchmarks Essenciais de Raciocínio e Linguagem
Em termos de conhecimento geral, os resultados dos benchmarks do Qwen 3.8 situam-se claramente acima da média típica da classe 3B. O modelo obtém resultados competitivos no MMLU e no MMLU-Pro, superando o que seria de esperar face à sua contagem de parâmetros em ambos. Onde o modelo realmente se destaca é no raciocínio estruturado: tanto o GSM8K (matemática do ensino básico) como o mais exigente benchmark MATH apresentam resultados sólidos, e o BBH (Big-Bench Hard), que testa raciocínio em várias etapas, também se mantém forte.
A programação é outro ponto forte. No HumanEval e no LiveCodeBench, o desempenho do Qwen 3.8 rivaliza com modelos na faixa dos 7B aos 14B, o que é pouco habitual para um modelo tão compacto.
Análise Detalhada dos Benchmarks de Raciocínio do Qwen 3.8
Os números mais interessantes vêm de tarefas ao nível de competição. Nos problemas de matemática AIME e AMC, os resultados dos benchmarks de raciocínio do Qwen 3.8, especialmente com o modo de pensamento alargado ativado, são notavelmente fortes para a sua classe de tamanho. O GPQA (Graduate-Level Google-Proof Q&A) continua a ser mais difícil, como acontece com todos os modelos pequenos, mas o Qwen 3.8 ainda assim atinge um bom nível para a sua categoria.
Nas tabelas classificativas da comunidade, como o Open LLM Leaderboard e o LMSYS Chatbot Arena, o modelo posiciona-se de forma consistente perto ou acima de modelos com três a cinco vezes mais parâmetros. Essa eficiência por parâmetro é, no fundo, toda a proposta do modelo.
Ler os Números com Sentido Crítico
Os benchmarks pedem cautela. A saturação faz com que os melhores modelos se aglomerem perto do limite máximo de pontuação, onde pequenas diferenças deixam de ter significado, e o risco de contaminação, quando dados de teste acabam por entrar nos conjuntos de treino, pode inflacionar os resultados. Existe também um fosso persistente entre as tarefas de benchmark e os pedidos reais, muitas vezes mais complexos e imprevisíveis.
Na prática, os números de destaque devem ser vistos como um indício, não uma garantia. Para tarefas do dia a dia, como redigir textos, resumir conteúdos e programação de rotina, o Qwen 3.8 tem um desempenho mais próximo da sua força nos benchmarks do que a maioria dos modelos pequenos. Já em raciocínio aberto e em contextos ambíguos, é de esperar maior variação.
3. Qwen 3.8 vs. Versões Anteriores do Qwen
Qwen 3.8 vs. Qwen 3.7: O Que Mudou?
A comparação entre Qwen 3.8 e Qwen 3.7 é sobretudo uma história de refinamento, e não de reformulação. O número de parâmetros mantém-se semelhante, mas o Qwen 3.8 traz dados de treino mais depurados, uma fase de alinhamento melhorada com afinação de preferências no estilo DPO, e uma melhor calibração do seu interruptor de raciocínio.
A diferença nos benchmarks é irregular, o que é honesto e esperado. As pontuações de matemática e programação melhoraram mais, o seguimento de instruções ficou mais rigoroso, e o conhecimento geral manteve-se praticamente igual, já que um modelo de 3,8B tem margem limitada para armazenar mais factos. O desempenho também melhorou ligeiramente graças a otimizações de atenção, pelo que se obtém geração de tokens um pouco mais rápida no mesmo hardware.
Como o Qwen 3.8 Se Encaixa na Família Qwen Mais Ampla
O Qwen 3.8 posiciona-se na extremidade mais eficiente de uma gama alargada que escala através do Qwen 3-14B, Qwen 3-32B e Qwen 3-72B. O compromisso é simples: o 3.8B dá-lhe velocidade, baixo custo e alojamento local fácil, enquanto os modelos maiores oferecem conhecimento mais profundo e raciocínio de longo alcance mais fiável.
Fique com o 3.8 para cargas de trabalho de grande volume, sensíveis à latência e com foco no custo. Suba para o 14B ou superior quando a precisão em tarefas complexas com múltiplos documentos for mais importante do que a velocidade ou o preço.
4. Comparações Diretas: Qwen 3.8 vs. GPT, Claude e Modelos Concorrentes de Pequena Dimensão
Qwen 3.8 vs. GPT (Nível de Pequenos Modelos da OpenAI)
No confronto entre Qwen 3.8 e GPT face ao nível de pequenos modelos da OpenAI, como o GPT-4o Mini, a questão resume-se a custo versus polimento. O Qwen 3.8 é competitivo nos testes de matemática e programação e pode ser auto-hospedado gratuitamente, enquanto o nível pequeno do GPT cobra por token através de uma API fechada. Os modelos GPT geralmente ganham na amplitude de conhecimento geral e na fiabilidade das ferramentas prontas a usar. Para as empresas, a troca prática está entre controlo e custo versus conveniência e maturidade do ecossistema.
Qwen 3.8 vs. Claude (Nível de Pequenos Modelos da Anthropic)
Na comparação entre Qwen 3.8 e Claude face ao nível pequeno da Anthropic, como o Claude Haiku, o Claude tende a destacar-se no alinhamento de segurança, no seguimento cuidadoso de instruções e na qualidade de resumo de contextos longos. A vantagem do Qwen 3.8 é a flexibilidade de implementação: pode executar os pesos abertos no seu próprio hardware, sem taxa por chamada e sem que os dados saiam do seu ambiente. O Claude é apenas um serviço alojado, por isso os requisitos de licenciamento e privacidade acabam frequentemente por decidir esta comparação.
Qwen 3.8 vs. Kimi K3 e Outros Modelos Abertos Concorrentes
Em qualquer comparação de LLMs open source, o Qwen 3.8 compara-se bem com o Kimi K3 e outros modelos abertos de 3B a 7B. Ganha na maioria das vezes em programação, matemática e cobertura multilingue. Onde fica atrás é na síntese de contextos muito longos e na profundidade dos ecossistemas de afinação especializada (fine-tuning), onde o Llama e o Mistral ainda têm um avanço de comunidade maior. Se a sua carga de trabalho for intensiva em código e raciocínio, o Qwen 3.8 é uma escolha sólida por defeito entre os modelos abertos.
Cansado dos custos de API por token para modelos de linguagem pequenos? A Bleap permite-lhe auto-hospedar modelos abertos como o Qwen 3.8, sem taxas por chamada e com total privacidade de dados. Obtenha o cartão Bleap →
5. Requisitos de Hardware do Qwen 3.8: O Que Precisa Para o Executar Localmente
Requisitos Mínimos de VRAM
Os requisitos de VRAM do Qwen 3.8 são surpreendentemente modestos. Com precisão total FP16, deve contar com aproximadamente 8 a 10 GB de VRAM, algo que uma placa como a RTX 4080 gere sem dificuldade. A quantização INT8 reduz esse valor para cerca de 5 a 6 GB, com apenas uma pequena perda de qualidade, o que coloca uma RTX 3060 de 12 GB perfeitamente dentro do alcance.
Com quantização INT4 ou GGUF, a exigência de VRAM cai para cerca de 3 a 4 GB, tornando a inferência apenas em CPU genuinamente viável para cargas de trabalho mais ligeiras. GPUs na cloud como a A10G dão-lhe bastante margem para fazer batching.
Hardware Recomendado para uma Inferência Local Fluida
Para uma geração de tokens rápida e fluida, uma única GPU de consumo com 12 GB é o ponto ideal para a maioria dos requisitos de hardware do Qwen 3.8. Vai precisar de pelo menos 16 GB de RAM no sistema e armazenamento NVMe, já que o ficheiro de pesos em FP16 tem cerca de 7 a 8 GB, sendo as versões quantizadas mais pequenas.
Um fallback apenas em CPU através do llama.cpp funciona, mas conte com apenas alguns tokens por segundo em hardware de secretária típico. Em Mac com Apple Silicon, o backend MPS executa o Qwen 3.8 bem, e a memória unificada faz com que uma máquina da série M com 16 GB ou mais lide com ele sem problemas.
Lista de Verificação para Planeamento de Hardware de LLM Auto-Hospedado
Ao planear o hardware para um LLM auto-hospedado, siga esta lista de verificação:
- VRAM da GPU: 4 GB no mínimo (INT4), 8 a 10 GB recomendado (FP16)
- RAM do sistema: 16 GB ou mais
- Armazenamento: SSD NVMe com 20 GB livres para pesos e cache
- Arrefecimento e energia: temperaturas estáveis para inferência sustentada
- Expectativas de desempenho: aproximadamente 40 a 80 tokens por segundo numa GPU de gama média, apenas alguns tokens por segundo em CPU
- Custo de funcionamento: uma GPU de gama média consome cerca de 150 a 250 watts em carga, o que torna a inferência local contínua bastante económica em comparação com a faturação por token das APIs
6. Como Aceder ao Qwen 3.8: Cloud, API e Implementação Local
Acesso na Cloud via Alibaba Cloud (Model Studio)
A forma mais direta de aceder à API do Qwen 3.8 é através do Model Studio da Alibaba Cloud. Cria uma conta, verifica-a e depois navega até ao endpoint do modelo Qwen para gerar uma chave de API. O Model Studio oferece quotas gratuitas e créditos de teste para avaliação, com limites de utilização publicados por chave. Convenientemente, o endpoint é compatível com o OpenAI, pelo que a maioria dos SDKs existentes funciona apenas com a troca do URL base.
Acesso à API do Qwen 3.8 através de Fornecedores Terceiros
Se preferires não usar a cloud da própria Alibaba, vários fornecedores terceiros disponibilizam modelos Qwen, incluindo a Together AI, a Fireworks AI, a Groq e o OpenRouter. A latência e os preços variam, sendo que a Groq geralmente lidera em velocidade bruta e o OpenRouter é útil para encaminhar pedidos entre diferentes fornecedores. Escolhe uma API de terceiros quando quiseres uma única relação de faturação ou menor latência numa região específica, e o endpoint da Alibaba quando quiseres a implementação de referência.
Guia de Implementação Local do Qwen 3.8
Para a implementação local do Qwen 3.8, tens quatro caminhos simples à disposição. Faz o download dos pesos a partir do Hugging Face Hub e carrega-os com a biblioteca transformers para teres controlo total. Para uma configuração num só comando, o Ollama descarrega e executa o modelo instantaneamente. Utilizadores menos técnicos podem usar a interface gráfica do LM Studio para descarregar e conversar com o modelo em poucos minutos. Para versões quantizadas em hardware mais modesto, obtém um ficheiro GGUF e executa-o através do llama.cpp.
7. Preços e Planos de Subscrição Explicados
O Alibaba Cloud Model Studio cobra o Qwen 3.8 por token, com taxas separadas para input e output, que ficam bem abaixo dos preços dos modelos de topo, tendo em conta o tamanho reduzido do modelo. Existe um plano gratuito com créditos de teste que permite experimentar antes de te comprometeres.
A grande decisão está em optar por alojamento próprio (self-hosting) ou pela API. Executar o Qwen 3.8 localmente tem, na prática, custo marginal quase nulo por pedido depois de pagares o hardware, por isso cargas de trabalho de grande volume beneficiam do self-hosting. Fornecedores externos como a Together AI e a Fireworks AI divulgam taxas por token competitivas que fazem sentido para utilizações pontuais ou de baixo volume, em que preferes não gerir infraestrutura. Como regra geral, se tens um tráfego constante e elevado, compensa investir em GPUs; se a utilização é ocasional ou imprevisível, compensa pagar por token.
Se subscreveres ferramentas de IA alojadas e cobradas em USD, não te esqueças do custo escondido que a maioria das pessoas ignora: um cartão típico acrescenta 2-3% em cada cobrança em moeda estrangeira. Com o Bleap, pagas em USD à taxa real, com 0% de comissões de câmbio, para que a tua despesa mensal com IA não infle sem dares por isso.
8. Estatuto Open-Source e Disponibilidade
O Qwen 3.8 é disponibilizado com uma licença de pesos abertos permissiva que autoriza o uso comercial, o que é uma das principais razões pelas quais as empresas levam este modelo a sério. Pode fazer download dos pesos através do Hugging Face Hub, no cartão oficial do modelo, e também através do ModelScope, para utilizadores na China.
A atividade da comunidade é saudável, com projetos ativos de fine-tuning, uma coleção crescente de quantizações feitas pela comunidade e uma comunidade de desenvolvedores empenhada em partilhar receitas e adaptadores. A Alibaba tem sido relativamente transparente quanto ao ritmo de lançamentos, o que reduz a incerteza em relação a futuras versões.
Em qualquer comparação de LLMs open source, o modelo de pesos abertos é a vantagem que mais se destaca. Elimina a dependência de um fornecedor específico, permite auditar e alojar o modelo internamente, e mantém os dados sensíveis dentro do seu próprio ambiente, exatamente por isso o desempenho dos LLMs pequenos em 2026 se tornou um espaço tão competitivo.
A correr IA no seu próprio hardware para poupar custos? Faça o mesmo com as suas subscrições. A Bleap oferece 0% de comissões de câmbio em ferramentas de IA faturadas em USD, além de um cashback fixo de 20% em Claude, ChatGPT e Gemini, sem qualquer subscrição mensal própria. Peça já o cartão Bleap →
9. Limitações Conhecidas e Ressalvas Antes de Mudar
Limites de Desempenho
Três vírgula oito mil milhões de parâmetros é, de facto, um valor reduzido, e isso nota-se nas tarefas mais exigentes. A síntese complexa de múltiplos documentos e as cadeias agentivas longas expõem esse limite, situações em que os modelos maiores raciocinam de forma mais fiável. As taxas de alucinação também aumentam em consultas que exigem muito conhecimento, quando comparadas com modelos maiores, e a qualidade diminui em línguas com poucos recursos fora do conjunto multilingue principal. O ideal é escolher o modelo certo para a tarefa certa, em vez de esperar um desempenho de topo.
Lacunas no Ecossistema e nas Ferramentas
A comunidade de fine-tuning à volta do Qwen está a crescer rapidamente, mas ainda é mais pequena do que os ecossistemas do Llama e do Mistral, por isso poderá encontrar menos adaptadores e receitas prontos a usar. A fiabilidade da chamada de ferramentas, embora sólida, pode ser inconsistente nas versões iniciais de qualquer lançamento. A documentação é razoável, mas não tão completa como a que a OpenAI e a Anthropic disponibilizam para os seus modelos alojados.
Considerações sobre Conformidade e Privacidade
O uso de endpoints da Alibaba Cloud levanta questões de residência de dados que os setores regulados devem avaliar com cuidado, além de requisitos de auditoria e registo de atividades. A grande vantagem aqui está nos pesos abertos: uma implementação self-hosted mantém todos os dados dentro da sua própria infraestrutura e elimina por completo o risco de privacidade associado à cloud. Para cargas de trabalho sensíveis, este é muitas vezes o fator decisivo a favor do Qwen 3.8.
10. Quem deve (e quem não deve) usar o Qwen 3.8 neste momento
Utilizadores ideais
- Programadores que estão a construir funcionalidades de IA leves com orçamentos de computação apertados
- Investigadores que precisam de um modelo open-weight competente para experiências de fine-tuning
- Empresas na região APAC que já operam sobre infraestrutura da Alibaba Cloud
- Entusiastas e "tinkerers" que correm LLMs locais em GPUs de consumo
Utilizadores que devem procurar outras opções
- Equipas que precisam de precisão de topo em tarefas com documentos longos, onde um modelo da classe 72B se adequa melhor
- Organizações que exigem fornecedores de API certificados SOC 2 ou HIPAA logo de início
- Programadores fortemente apostados nos ecossistemas de fine-tuning do Llama ou do Mistral
Resumindo: opte pelo Qwen 3.8 quando a velocidade, o custo e o self-hosting forem as prioridades principais, e procure outra opção quando a precisão em tarefas difíceis e de elevado risco for inegociável.
Perguntas frequentes sobre o Qwen 3.8
Quais são os requisitos de hardware do Qwen 3.8 para correr localmente?
Em precisão total FP16, conte com cerca de 8 a 10 GB de VRAM. Com quantização INT4 ou GGUF, esse valor desce para cerca de 3 a 4 GB, tornando viável a inferência apenas em CPU para tarefas mais leves. Consulte a Secção 5 para a análise completa.
Como se compara o Qwen 3.8 com o GPT-4o Mini e o Claude Haiku?
O Qwen 3.8 é competitivo em benchmarks de matemática e programação e pode ser alojado por conta própria, gratuitamente. O GPT-4o Mini e o Claude Haiku geralmente destacam-se em conhecimento geral, refinamento de segurança e fiabilidade de ferramentas, mas cobram por token através de APIs fechadas. Encontra todos os detalhes na Secção 4.
O Qwen 3.8 é totalmente open source e gratuito para uso comercial?
Sim. O Qwen 3.8 é disponibilizado sob uma licença de pesos abertos (open-weights) permissiva, que permite uso comercial. Pode descarregar os pesos a partir do Hugging Face Hub, através da ficha oficial do modelo, ou a partir do ModelScope.
Em que benchmarks é que o Qwen 3.8 obtém melhores resultados?
Programação e matemática são as suas categorias mais fortes. Obtém pontuações elevadas em HumanEval e LiveCodeBench para programação, além de resultados impressionantes em GSM8K e MATH, muitas vezes rivalizando com modelos com várias vezes mais parâmetros.
Qual é a diferença entre o Qwen 3.8 e o Qwen 3.7?
O Qwen 3.8 aperfeiçoa em vez de reinventar. Traz dados de treino mais limpos, um alinhamento de preferências melhorado e uma calibração de raciocínio mais afinada, com os maiores ganhos em matemática e programação. O conhecimento geral mantém-se praticamente estável. Consulte a Secção 3.
Como posso acessar a API do Qwen 3.8?
A forma mais simples é através do Alibaba Cloud Model Studio, que oferece um endpoint compatível com a OpenAI e um plano gratuito com créditos de avaliação. Fornecedores terceiros como Together AI, Fireworks AI, Groq e OpenRouter também o disponibilizam. Consulte a Secção 6.
Conclusão: O Qwen 3.8 merece a tua atenção em 2026?
O Qwen 3.8 oferece um desempenho competitivo em raciocínio e programação com apenas 3,8 mil milhões de parâmetros, e é precisamente isso que o torna digno de atenção. As suas vitórias notáveis em benchmarks de matemática e código, aliadas a uma licença open-weights e a uma hospedagem local simples, colocam-no perto do topo do panorama dos LLMs pequenos em 2026.
As limitações são reais e merecem ser respeitadas: o limite do tamanho nota-se em trabalhos complexos com documentos longos, e o ecossistema de fine-tuning ainda está a maturar em comparação com o Llama e o Mistral. Ainda assim, o cenário ideal de utilização é claro. Escolhe o Qwen 3.8 para cargas de trabalho sensíveis ao custo, de grande volume e auto-hospedadas, e recorre a um modelo maior quando a precisão em tarefas difíceis pesa mais do que a velocidade e o preço. Dado o ritmo constante de lançamentos da Alibaba, novas melhorias parecem estar prestes a chegar.
Seja qual for o caminho que escolheres, quer ativares uma instância local quer subscrevas um modelo alojado, paga de forma inteligente. Com o Bleap evitas as taxas de câmbio nas subscrições em USD, e no Claude, ChatGPT e Gemini ganhas 20% de cashback fixo em cada renovação. Obtém o cartão Bleap →
Uma forma mais inteligente de gastar, enviar, ganhar e negociar

- Artificial Inteligence








