Qwen 3.8: Specifiche, Benchmark, Prezzi e Guida Completa (2026)
5 August 2026 · Aggiornato 5 August 2026

Gabriel Caetano
ARTIFICIAL INTELIGENCE
Qwen 3.8: Specifiche, Benchmark, Prezzi e Guida Completa (2026)
Scopri tutto su Qwen 3.8, il modello IA open-weight compatto di Alibaba. Confronta benchmark, specifiche, prezzi, requisiti hardware, API e le differenze rispetto a GPT, Claude e altri LLM.

Tutto su Qwen 3.8: specifiche, benchmark e ciò che devi sapere
Qwen 3.8 è un modello linguistico compatto da 3,8 miliardi di parametri, ottimizzato per seguire istruzioni, sviluppato dal team Qwen di Alibaba per offrire ottime prestazioni di ragionamento e coding a una frazione del costo computazionale dei modelli più avanzati. Funziona su GPU consumer, viene distribuito con una licenza open-weights permissiva e regge il confronto con modelli molte volte più grandi nei benchmark di matematica e programmazione. Detto questo, 3,8 miliardi di parametri restano comunque pochi, quindi il modello sacrifica un po' di profondità su documenti lunghi e compiti che richiedono molta conoscenza, in cambio di velocità e convenienza.
Se negli ultimi due anni hai visto i modelli linguistici gonfiarsi fino a centinaia di miliardi di parametri, Qwen 3.8 ribalta completamente la situazione. La famiglia Qwen di Alibaba continua a rimpicciolirsi in termini di dimensioni pure, mentre le capacità crescono, e Qwen 3.8 è la prova più chiara finora che "piccolo" può davvero significare "utile". È un modello compatto, ottimizzato per seguire istruzioni, pensato per gli sviluppatori che vogliono un buon ragionamento senza il budget di un data center.
Perché è importante nel 2026? Perché oggi il costo computazionale è il fattore decisivo per la maggior parte dei team, e un modello che ragiona bene su una singola GPU di fascia media cambia le carte in tavola sull'economia del lancio di funzionalità basate sull'AI. Questa guida analizza specifiche, benchmark, confronti tra versioni, requisiti hardware, modalità di deployment, prezzi e limiti, così potrai decidere se Qwen 3.8 merita un posto nel tuo stack.
Una nota pratica prima di iniziare: che tu usi Qwen 3.8 in locale o paghi un abbonamento AI in hosting, anche il lato pagamenti conta. La maggior parte delle carte applica una commissione del 2-3% sulle transazioni estere per i servizi AI fatturati in USD, ed è esattamente qui che una carta con 0% di commissioni FX si fa notare.
Paghi ogni mese ChatGPT, Claude o Gemini? Bleap applica 0% di commissioni FX sui tuoi abbonamenti in USD e ti dà un cashback fisso del 20% su Claude, ChatGPT e Gemini, con una Mastercard self-custodial e nessun abbonamento richiesto. (Il cashback del 20% si applica solo a Claude, ChatGPT e Gemini.) Scopri la carta Bleap →
1. Qwen 3.8 in breve: architettura, specifiche e funzionalità principali
Le basi dell'architettura del modello
Qwen 3.8 è un transformer denso con 3,8 miliardi di parametri. A differenza dei design a mixture-of-experts, che attivano solo una parte della rete per ogni query, qui ogni parametro viene utilizzato a ogni passaggio: questo rende il comportamento del modello prevedibile e semplifica il deployment. Il modello Alibaba Qwen usa l'attenzione grouped-query per ridurre il carico di memoria durante l'inferenza, gli embedding posizionali RoPE per gestire in modo stabile i contesti lunghi, e attivazioni SwiGLU nei layer feed-forward.
La finestra di contesto supporta fino a 128.000 posizioni nella configurazione estesa, con un tokenizer byte-pair-encoding ottimizzato sia per gli alfabeti latini che per le lingue CJK (cinese, giapponese, coreano). L'addestramento si basa su un ampio corpus multilingue con un cutoff di conoscenza recente, e il modello è disponibile in due versioni: una variante base per ulteriori fine-tuning e una variante instruction-tuned, allineata per chat e per seguire istruzioni. La maggior parte degli utenti vorrà usare la versione instruction-tuned.
A cosa serve Qwen 3.8
L'architettura del modello Qwen è pensata per quattro compiti principali: assistenza alla programmazione, ragionamento multi-step, capacità di seguire istruzioni e sintesi di testi. Gestisce nativamente inglese e cinese, con una buona copertura multilingue aggiuntiva per le principali lingue europee e asiatiche.
Oltre alla generazione di testo standard, Qwen 3.8 supporta il function calling e l'uso strutturato di strumenti esterni, il che lo rende un motore valido per agenti leggeri. Una caratteristica degna di nota è la modalità di ragionamento chain-of-thought, con un interruttore per il "pensiero esteso" che permette al modello di dedicare più potenza di calcolo ai problemi difficili e meno a quelli semplici. Per un modello da 3,8B, questo ragionamento adattivo è un elemento distintivo non da poco.
2. Risultati dei benchmark di Qwen 3.8: cosa dicono davvero i numeri
Benchmark principali su ragionamento e linguaggio
Per quanto riguarda la cultura generale, i punteggi del benchmark di Qwen 3.8 si posizionano ben al di sopra della media tipica dei modelli di classe 3B. Ottiene risultati competitivi su MMLU e MMLU-Pro, superando le aspettative legate al suo numero di parametri in entrambi i casi. Ma è nel ragionamento strutturato che il modello si distingue davvero: sia GSM8K (matematica delle elementari/medie) che il più impegnativo MATH benchmark mostrano numeri solidi, e anche BBH (Big-Bench Hard), che misura il ragionamento multi-step, tiene bene il confronto.
Anche la programmazione è un punto forte. Su HumanEval e LiveCodeBench, le prestazioni di Qwen 3.8 rivaleggiano con modelli nella fascia 7B-14B, il che è piuttosto inusuale per un modello così compatto.
Approfondimento sul benchmark di ragionamento di Qwen 3.8
I numeri più interessanti arrivano dai task di livello competitivo. Sui problemi matematici di AIME e AMC, i risultati del benchmark di ragionamento di Qwen 3.8, soprattutto con la modalità di pensiero estesa attivata, sono decisamente solidi per la sua fascia dimensionale. GPQA (Graduate-Level Google-Proof Q&A) resta più ostico, come del resto per qualsiasi modello piccolo, ma Qwen 3.8 riesce comunque a superare la soglia prevista per la sua categoria.
Nelle classifiche della community, come l'Open LLM Leaderboard e la LMSYS Chatbot Arena, si posiziona costantemente vicino o sopra a modelli con un numero di parametri da tre a cinque volte superiore. Questa efficienza per parametro è proprio il punto centrale del modello.
Leggere i numeri con occhio critico
I benchmark premiano la cautela. La saturazione fa sì che i modelli migliori si raggruppino vicino ai punteggi massimi, dove le piccole differenze perdono significato, e il rischio di contaminazione, cioè quando i dati di test finiscono nei set di addestramento, può gonfiare artificialmente i risultati. Esiste inoltre uno scarto persistente tra i task dei benchmark e i prompt reali, spesso più caotici e imprevedibili.
In pratica, è meglio considerare i numeri principali come un indizio, non una garanzia. Per attività quotidiane come scrivere bozze, riassumere testi o programmare in modo ordinario, Qwen 3.8 si comporta in modo più coerente con i risultati dei benchmark rispetto alla maggior parte dei modelli piccoli. Per il ragionamento aperto in condizioni di ambiguità, invece, aspettati una maggiore variabilità.
3. Qwen 3.8 vs. le versioni precedenti di Qwen
Qwen 3.8 vs. Qwen 3.7: cosa è cambiato?
Il confronto tra Qwen 3.8 e Qwen 3.7 racconta soprattutto una storia di affinamento, non di riprogettazione. Il numero di parametri resta pressoché invariato, ma Qwen 3.8 porta con sé dati di addestramento più puliti, un passaggio di alignment migliorato basato su preference tuning in stile DPO e una calibrazione più precisa del suo interruttore di ragionamento.
Il delta nei benchmark è irregolare, ma questo è onesto e prevedibile. I punteggi in matematica e coding sono quelli migliorati di più, il seguire le istruzioni è diventato più preciso, mentre la conoscenza generale è rimasta più o meno stabile, dato che un modello da 3,8B ha uno spazio limitato per memorizzare altri fatti. Anche il throughput è migliorato leggermente grazie alle ottimizzazioni sull'attenzione, quindi si ottiene una generazione di token un po' più rapida sullo stesso hardware.
Come si inserisce Qwen 3.8 nella famiglia Qwen più ampia
Qwen 3.8 si posiziona all'estremità più efficiente di una gamma ampia, che sale fino a Qwen 3-14B, Qwen 3-32B e Qwen 3-72B. Il compromesso è chiaro: il 3.8B ti dà velocità, costi bassi e facilità di hosting locale, mentre i modelli più grandi offrono conoscenze più approfondite e un ragionamento più affidabile su testi lunghi.
Resta su 3.8 per carichi di lavoro ad alto volume, sensibili alla latenza e attenti ai costi. Passa a 14B o oltre quando la precisione su task complessi e multi-documento conta più della velocità o del prezzo.
4. Confronto diretto: Qwen 3.8 contro GPT, Claude e i modelli piccoli concorrenti
Qwen 3.8 contro GPT (fascia small-model di OpenAI)
Nel confronto Qwen 3.8 contro GPT rispetto alla fascia small-model di OpenAI, come GPT-4o Mini, la partita si gioca tra costo e rifinitura. Qwen 3.8 è competitivo nei benchmark di matematica e coding e può essere self-hosted gratuitamente, mentre la fascia small di GPT fattura per token tramite un'API chiusa. I modelli GPT generalmente vincono per ampiezza di conoscenza generale e affidabilità "out-of-the-box" degli strumenti. Per le aziende, il compromesso pratico è controllo e costo contro comodità e maturità dell'ecosistema.
Qwen 3.8 contro Claude (fascia small-model di Anthropic)
Nel confronto Qwen 3.8 contro Claude rispetto alla fascia small di Anthropic, come Claude Haiku, Claude tende a primeggiare su alignment per la sicurezza, capacità di seguire istruzioni con precisione e qualità nella sintesi di contesti lunghi. Il vantaggio di Qwen 3.8 sta nella flessibilità di deployment: puoi eseguire i pesi open sul tuo stesso hardware, senza costi per chiamata e senza che i dati escano dal tuo ambiente. Claude è disponibile solo come servizio hosted, quindi requisiti di licenza e privacy spesso fanno la differenza in questo confronto.
Qwen 3.8 contro Kimi K3 e altri modelli open concorrenti
In qualsiasi confronto tra LLM open source, Qwen 3.8 si difende bene contro Kimi K3 e altri modelli open comparabili nella fascia 3B-7B. Vince più spesso su coding, matematica e copertura multilingue. Dove è più debole è nella sintesi di contesti molto lunghi e nella profondità degli ecosistemi di fine-tuning di nicchia, dove Llama e Mistral hanno ancora un vantaggio grazie a una community più grande e consolidata. Se il tuo carico di lavoro è incentrato su codice e ragionamento, Qwen 3.8 è una scelta solida di default tra i modelli open.
Stufo dei costi API per token con i piccoli modelli linguistici? Con Bleap puoi fare self-hosting di modelli open come Qwen 3.8 senza costi per chiamata e con piena privacy dei dati. Scopri la carta Bleap →
5. Requisiti hardware di Qwen 3.8: cosa serve per eseguirlo in locale
Requisiti minimi di VRAM
I requisiti di VRAM di Qwen 3.8 sono piacevolmente contenuti. In piena precisione FP16 bastano circa 8-10 GB di VRAM, una soglia che una scheda come la RTX 4080 gestisce senza problemi. Con la quantizzazione INT8 la soglia scende a circa 5-6 GB, con solo una minima perdita di qualità, il che porta una RTX 3060 12 GB ampiamente nel range utile.
Con la quantizzazione INT4 o GGUF, il fabbisogno di VRAM scende a circa 3-4 GB, e l'inferenza solo su CPU diventa davvero praticabile per carichi di lavoro più leggeri. Le GPU cloud come l'A10G offrono ampio margine per il batching.
Hardware consigliato per un'inferenza locale fluida
Per una generazione di token rapida e fluida, una singola GPU consumer da 12 GB rappresenta il punto ideale per la maggior parte dei requisiti hardware di Qwen 3.8. Ti servono almeno 16 GB di RAM di sistema e uno storage NVMe, dato che il file dei pesi in FP16 pesa circa 7-8 GB, mentre le versioni quantizzate sono più leggere.
Un fallback solo su CPU tramite llama.cpp funziona, ma aspettati velocità a una sola cifra di token al secondo su hardware desktop tipico. Su Mac con Apple Silicon, il backend MPS fa girare Qwen 3.8 molto bene, e la memoria unificata fa sì che una macchina della serie M con 16 GB o più se la cavi egregiamente.
Checklist per pianificare l'hardware per un LLM self-hosted
Quando pianifichi l'hardware per un LLM self-hosted, tieni sotto controllo questi punti:
- VRAM della GPU: 4 GB minimo (INT4), 8-10 GB consigliati (FP16)
- RAM di sistema: 16 GB o più
- Storage: SSD NVMe con 20 GB liberi per pesi e cache
- Raffreddamento e alimentazione: temperature stabili per un'inferenza prolungata
- Aspettative di throughput: circa 40-80 token al secondo su una GPU di fascia media, a una sola cifra con la sola CPU
- Costi di gestione: una GPU di fascia media consuma circa 150-250 watt sotto carico, quindi l'inferenza locale continua ha un costo contenuto rispetto alla fatturazione per token delle API
6. Come accedere a Qwen 3.8: cloud, API e installazione locale
Accesso via cloud con Alibaba Cloud (Model Studio)
Il modo più diretto per accedere all'API di Qwen 3.8 è Model Studio di Alibaba Cloud. Crea un account, verificalo, poi vai all'endpoint del modello Qwen per generare una chiave API. Model Studio offre quote gratuite e crediti di prova per fare i primi test, con limiti di utilizzo pubblicati per ogni chiave. Un vantaggio non da poco: l'endpoint è compatibile con OpenAI, quindi la maggior parte degli SDK esistenti funziona semplicemente cambiando l'URL di base.
Accesso all'API di Qwen 3.8 tramite provider terzi
Se preferisci non passare dal cloud di Alibaba, diversi provider terzi offrono i modelli Qwen, tra cui Together AI, Fireworks AI, Groq e OpenRouter. Latenza e prezzi variano da provider a provider: Groq generalmente vince in termini di velocità pura, mentre OpenRouter è utile per instradare le richieste tra diversi fornitori. Scegli un'API di terze parti se vuoi un unico rapporto di fatturazione o una latenza più bassa in una determinata area geografica, oppure l'endpoint di Alibaba se preferisci l'implementazione di riferimento.
Guida all'installazione locale di Qwen 3.8
Per installare Qwen 3.8 in locale hai quattro strade semplici da seguire. Scarica i pesi dall'Hugging Face Hub e caricali con la libreria transformers per avere il controllo completo. Se vuoi una configurazione con un solo comando, Ollama scarica ed esegue il modello all'istante. Chi non ha competenze tecniche può usare l'interfaccia grafica di LM Studio per scaricare il modello e iniziare a chattarci in pochi minuti. Per versioni quantizzate su hardware meno potente, prendi un file GGUF ed eseguilo tramite llama.cpp.
7. Prezzi e piani di abbonamento spiegati
Alibaba Cloud Model Studio fattura Qwen 3.8 a consumo, in base ai token, con tariffe separate per input e output che restano ben al di sotto dei prezzi dei modelli di punta, viste le dimensioni contenute del modello. C'è anche un piano gratuito con crediti di prova per testarlo prima di impegnarsi.
La scelta più importante riguarda self-hosting contro API. Far girare Qwen 3.8 in locale ha un costo marginale praticamente pari a zero per ogni richiesta, una volta ammortizzato l'hardware: per questo i carichi di lavoro ad alto volume convengono in self-hosting. Provider terzi come Together AI e Fireworks AI offrono tariffe per token competitive, ideali per un utilizzo saltuario o irregolare, quando non vuoi occuparti di gestire l'infrastruttura. Come regola generale: se hai un traffico costante e sostenuto, conviene comprare la GPU; se l'uso è occasionale o imprevedibile, meglio pagare a token.
Se ti abboni a strumenti AI in hosting fatturati in USD, ricorda il costo nascosto che quasi tutti trascurano: una carta tradizionale aggiunge in genere il 2-3% su ogni pagamento in valuta estera. Con Bleap paghi in USD al tasso reale, con 0% di commissioni sul cambio, così la tua spesa mensile per l'AI non lievita di nascosto.
8. Stato open source e disponibilità
Qwen 3.8 viene distribuito con una licenza open-weights permissiva che ne consente l'uso commerciale, e questo è uno dei motivi principali per cui le aziende lo prendono sul serio. Puoi scaricare i pesi dall'Hugging Face Hub tramite la model card ufficiale, oppure da ModelScope se ti trovi in Cina.
L'attività della community è vivace: ci sono progetti di fine-tuning attivi, una raccolta sempre più ampia di quantizzazioni realizzate dalla community e un gruppo di sviluppatori coinvolto che condivide ricette e adapter. Alibaba è stata piuttosto trasparente sul proprio ritmo di rilascio, il che riduce l'incertezza sulle versioni future.
In qualsiasi confronto tra LLM open source, il modello a pesi aperti resta il vantaggio più evidente. Elimina il vincolo verso un unico fornitore, ti permette di verificare il codice e ospitarlo sui tuoi server, e mantiene i dati sensibili nel tuo ambiente: è esattamente per questo che le performance dei modelli LLM di piccole dimensioni nel 2026 sono diventate un terreno di gara così competitivo.
Fai girare l'AI sul tuo hardware per tagliare i costi? Fai lo stesso con i tuoi abbonamenti. Bleap ti offre 0% di commissioni sul cambio valuta sugli strumenti AI fatturati in USD, più un cashback fisso del 20% su Claude, ChatGPT e Gemini, senza alcun abbonamento mensile proprio. Scopri la carta Bleap →
9. Limiti noti e avvertenze prima di passare a Qwen 3.8
I limiti prestazionali
Tre miliardi e ottocento milioni di parametri sono davvero pochi, e si nota nei task più complessi. La sintesi multi-documento e le catene agentiche lunghe fanno emergere il tetto massimo del modello, laddove i modelli più grandi ragionano in modo più affidabile. Anche il tasso di allucinazioni aumenta nelle query che richiedono molta conoscenza rispetto ai modelli più grandi, e la qualità scende per le lingue a basse risorse che non fanno parte del set multilingue principale. Meglio scegliere il modello in base al compito da svolgere, senza aspettarsi prestazioni da modello di punta.
Le lacune nell'ecosistema e negli strumenti
La community di fine-tuning attorno a Qwen sta crescendo rapidamente, ma è ancora più piccola rispetto agli ecosistemi di Llama e Mistral, quindi potresti trovare meno adapter e ricette già pronti. Il tool-calling, anche se solido, può risultare incostante nelle prime versioni di qualsiasi release. La documentazione è discreta, ma non così approfondita come quella che OpenAI e Anthropic offrono per i loro modelli hosted.
Considerazioni su conformità e privacy
Usare gli endpoint di Alibaba Cloud solleva questioni di data residency che i settori regolamentati devono valutare con attenzione, insieme ai requisiti di audit trail e logging. Il grande punto a favore, qui, sono i pesi open: un deployment self-hosted mantiene tutti i dati all'interno della tua infrastruttura ed elimina completamente il rischio privacy legato al cloud. Per i workload sensibili, questo è spesso il fattore decisivo a favore di Qwen 3.8.
10. Chi dovrebbe (e chi non dovrebbe) usare Qwen 3.8 in questo momento
Gli utenti ideali
- Sviluppatori che costruiscono funzionalità AI leggere con budget di calcolo limitati
- Ricercatori che hanno bisogno di un modello open-weight capace per esperimenti di fine-tuning
- Aziende nell'area APAC che già lavorano sull'infrastruttura Alibaba Cloud
- Appassionati e sperimentatori che fanno girare LLM in locale su GPU consumer
Chi dovrebbe guardare altrove
- Team che hanno bisogno di massima precisione su attività con documenti lunghi, dove un modello di classe 72B si adatta meglio
- Organizzazioni che richiedono provider API certificati SOC 2 o HIPAA già pronti all'uso
- Sviluppatori fortemente radicati negli ecosistemi di fine-tuning di Llama o Mistral
In breve: scegli Qwen 3.8 quando velocità, costi e self-hosting sono le priorità principali, mentre conviene puntare più in alto o guardare altrove quando la precisione su compiti difficili e ad alto rischio non è negoziabile.
Domande frequenti su Qwen 3.8
Quali sono i requisiti hardware di Qwen 3.8 per l'esecuzione in locale?
Con la piena precisione FP16, calcola all'incirca 8-10 GB di VRAM. Con la quantizzazione INT4 o GGUF, questo valore scende a circa 3-4 GB, rendendo possibile l'inferenza anche solo su CPU per i task più leggeri. Trovi tutti i dettagli nella Sezione 5.
Come si confronta Qwen 3.8 con GPT-4o Mini e Claude Haiku?
Qwen 3.8 è competitivo nei benchmark di matematica e coding e può essere ospitato in autonomia gratuitamente. GPT-4o Mini e Claude Haiku generalmente sono più avanti su conoscenza generale, affinamento della sicurezza e affidabilità nell'uso degli strumenti, ma vengono fatturati a token tramite API chiuse. Trovi tutti i dettagli nella Sezione 4.
Qwen 3.8 è completamente open source e utilizzabile gratuitamente in ambito commerciale?
Sì. Qwen 3.8 viene distribuito con una licenza open-weights permissiva che consente l'uso commerciale. Puoi scaricare i pesi dall'Hugging Face Hub tramite la scheda ufficiale del modello, oppure da ModelScope.
In quali benchmark Qwen 3.8 ottiene i punteggi più alti?
Coding e matematica sono le sue categorie di punta. Registra punteggi solidi in HumanEval e LiveCodeBench per il coding, oltre a risultati notevoli in GSM8K e MATH, spesso alla pari con modelli con un numero di parametri diverse volte superiore.
Qual è la differenza tra Qwen 3.8 e Qwen 3.7?
Qwen 3.8 affina piuttosto che reinventare. Porta dati di addestramento più puliti, un allineamento delle preferenze migliorato e una calibrazione del ragionamento più precisa, con i miglioramenti maggiori in matematica e coding. La conoscenza generale resta pressoché invariata. Vedi la Sezione 3.
Come posso accedere all'API di Qwen 3.8?
La strada più semplice è Alibaba Cloud Model Studio, che offre un endpoint compatibile con OpenAI e un piano gratuito con crediti di prova. Anche provider terzi come Together AI, Fireworks AI, Groq e OpenRouter lo mettono a disposizione. Vedi la Sezione 6.
Conclusione: Qwen 3.8 merita la tua attenzione nel 2026?
Qwen 3.8 offre prestazioni di ragionamento e coding competitive con soli 3,8 miliardi di parametri, ed è proprio questo il motivo per cui merita attenzione. I suoi risultati eccellenti nei benchmark di matematica e codice, uniti a una licenza open-weight e a un hosting locale semplice da configurare, lo collocano ai vertici del panorama degli LLM di piccole dimensioni nel 2026.
I limiti sono reali e vanno tenuti in considerazione: le dimensioni ridotte si fanno sentire sui documenti lunghi e complessi, e l'ecosistema di fine-tuning è ancora in fase di maturazione rispetto a quello di Llama e Mistral. Il quadro generale, però, è chiaro. Scegli Qwen 3.8 per carichi di lavoro self-hosted, ad alto volume e sensibili ai costi, mentre conviene puntare su un modello più grande quando la precisione sui task complessi conta più della velocità e del prezzo. Considerato il ritmo costante con cui Alibaba rilascia aggiornamenti, nuovi miglioramenti sembrano dietro l'angolo.
Qualunque strada tu scelga, che tu avvii un'istanza locale o ti abboni a un modello in cloud, paga in modo intelligente. Con Bleap eviti le commissioni di cambio valuta sugli abbonamenti in USD, e su Claude, ChatGPT e Gemini ottieni un cashback fisso del 20% a ogni rinnovo. Scopri la carta Bleap →
Un modo più intelligente di spendere, inviare, guadagnare e fare trading

- Artificial Inteligence








