Cos’è Ollama? Guida Completa per Eseguire Modelli AI in Locale
9 August 2026 · Aggiornato 9 August 2026

Gabriel Caetano
ARTIFICIAL INTELIGENCE
Cos’è Ollama? Guida Completa per Eseguire Modelli AI in Locale
Scopri cos’è Ollama, come funziona e come eseguire modelli AI in locale. Impara a installarlo, scegliere i modelli, usare API e CLI e creare flussi di lavoro AI privati senza dipendere dal cloud.

Cos'è Ollama? La guida completa per eseguire modelli AI in locale
Ollama è uno strumento gratuito e open-source che ti permette di scaricare ed eseguire large language model come Llama 3, Mistral e Gemma direttamente sul tuo computer, tramite un server API locale che gira su http://localhost:11434. Esiste perché non tutti vogliono inviare i propri prompt a un provider cloud o pagare tariffe per ogni token. Detto questo, le prestazioni in locale dipendono interamente dal tuo hardware, quindi un modello cloud all'avanguardia resterà comunque più performante nei task di ragionamento più impegnativi.
Questa guida spiega cos'è Ollama, come funziona, come installarlo, quali modelli scegliere e dove si colloca nel panorama attuale, oltre al modo più intelligente per pagare abbonamenti AI come Claude, ChatGPT e Gemini senza perdere soldi in commissioni di cambio valuta.
Paghi ogni mese per ChatGPT, Claude o Gemini? Bleap applica 0% di commissioni FX sui tuoi abbonamenti in USD e ti dà un cashback fisso del 20% su Claude, ChatGPT e Gemini, con una Mastercard self-custodial e senza alcun abbonamento proprio. (Il cashback del 20% si applica solo a Claude, ChatGPT e Gemini.) Ottieni la carta Bleap →
1. Cos'è Ollama?
Ollama è un runner gratuito e open-source per grandi modelli linguistici, pensato per rendere accessibili i modelli AI locali anche su un normale hardware da consumatore. Si occupa lui delle parti più complicate nel far girare un LLM: scarica i pesi del modello, gestisce lo storage, rileva la tua GPU e ti mette a disposizione un'interfaccia semplice per chattare con il modello.
È uscito nel 2023 ed è diventato in fretta uno degli strumenti LLM open-source più popolari per chi vuole un'AI alle proprie condizioni. Il valore centrale è semplice: scaricare, gestire e chattare con gli LLM interamente sul proprio computer, senza chiave API, senza abbonamenti e senza che i dati escano mai dal tuo dispositivo.
A chi è rivolto? A sviluppatori solitari, piccoli team, ricercatori e utenti attenti alla privacy che vogliono il pieno controllo su dove finiscono i loro prompt e su quanto spendono.
2. Come funziona Ollama
In generale, Ollama funziona come un server locale sul tuo computer. Carica i pesi del modello in memoria ed espone un'API REST su localhost, con cui possono comunicare sia la riga di comando che qualsiasi app collegata.
I modelli arrivano in un formato quantizzato basato su GGUF e si scaricano dalla libreria di modelli di Ollama con un solo comando. Una volta scaricato un modello, l'intero ciclo di inferenza avviene sul tuo dispositivo: il prompt entra, il modello lo elabora localmente e la risposta torna indietro, senza alcun passaggio dal cloud.
La quantizzazione è il trucco chiave. Comprimendo i pesi del modello in formati numerici più piccoli, la quantizzazione permette ai large language model di girare su normali GPU consumer, e persino su macchine con sola CPU, senza bisogno di un data center.
Componenti principali dell'architettura
- Server API locale: per impostazione predefinita è in ascolto su http://localhost:11434, così qualsiasi strumento può connettersi.
- Livello di storage dei modelli: dopo il primo download i modelli vengono salvati in cache su disco, quindi non serve riscaricarli ogni volta.
- Astrazione hardware: rilevamento automatico della GPU (NVIDIA CUDA, Apple Metal o AMD ROCm), con fallback su CPU quando non è disponibile una GPU.
3. Caratteristiche principali di Ollama
- Libreria di modelli Ollama: una raccolta curata di LLM open-source popolari, pronti da scaricare e consultabili per nome, dimensione e tag.
- Supporto multipiattaforma: installer nativi per macOS, Linux e Windows.
- API compatibile con OpenAI: un endpoint sostitutivo che rende la migrazione del codice esistente dalle API cloud un gioco da ragazzi.
- Personalizzazione tramite Modelfile: definisci prompt di sistema, parametri e modelli base con una configurazione semplice, in stile Dockerfile.
- Esecuzione simultanea di più modelli: puoi far girare più modelli contemporaneamente (dalla v0.5 in poi), utile per configurazioni multi-agente.
- CLI leggera: un'interfaccia a riga di comando intuitiva per scaricare, eseguire e gestire i modelli.
4. Ollama vs. AI su cloud (ChatGPT, Claude e altri)
Fattore | Ollama (locale) | ChatGPT / Claude (cloud) |
|---|---|---|
Privacy | Controllo totale dei dati | Dati elaborati sui server del fornitore |
Costo | Gratis dopo l'acquisto dell'hardware | Abbonamento o costi per token |
Latenza | Dipende dalla GPU locale | Bassa, data center ottimizzati |
Serve internet | Solo per scaricare il modello | Sempre |
Scelta dei modelli | Libreria open-source | Legato al fornitore |
Impegno per la configurazione | Moderato | Nessuno |
Sul fronte privacy, Ollama tiene tutto sul tuo computer, mentre gli strumenti cloud elaborano i tuoi prompt sull'infrastruttura del fornitore. Sui costi, Ollama è gratuito una volta che possiedi l'hardware, mentre i servizi cloud ti fanno pagare mensilmente o a richiesta. Il cloud vince su latenza e configurazione, perché i data center ottimizzati rispondono velocemente e non richiedono nessuna installazione da parte tua. Ollama vince sulla scelta dei modelli, offrendoti una libreria aperta invece di un singolo modello legato a un fornitore.
Il punto è questo: Ollama vince su privacy e costi per l'AI locale, mentre il cloud vince su prestazioni pure e comodità a configurazione zero. Non è un sostituto per ogni caso d'uso, ma un ottimo complemento per scenari sensibili alla privacy o offline.
Ancora paghi il prezzo pieno per il tuo piano AI sul cloud ogni mese? Con Bleap paghi Claude, ChatGPT e Gemini in USD al cambio reale, quindi 0% di commissioni sul cambio valuta, più un cashback fisso del 20% su questi tre abbonamenti. Scopri la carta Bleap →
5. Requisiti di sistema e installazione
Requisiti di sistema per Ollama
- macOS: 13 Ventura o versioni successive; consigliato Apple Silicon (M1/M2/M3), ma va bene anche Intel.
- Windows: Windows 10/11 (64-bit); una GPU NVIDIA con CUDA 11.3+ oppure una GPU AMD con ROCm sono opzionali ma consigliate.
- Linux: Ubuntu 20.04+ o distribuzioni equivalenti, con lo stesso supporto GPU previsto per Windows.
- RAM: minimo 8 GB per i modelli da 7B, 16 GB consigliati, e almeno 32 GB per i modelli da 13B in su.
- Spazio su disco: i modelli vanno da circa 2 GB (versione quantizzata da 3B) fino a 40 GB o più (70B), quindi calcola lo spazio di conseguenza.
- Solo CPU: supportato, ma decisamente più lento, meglio riservarlo ai modelli piccoli (da 1B a 3B).
Guida all'installazione di Ollama (passo dopo passo)
- macOS / Windows: scarica il programma di installazione da ollama.com, avvialo, e Ollama partirà come servizio in background.
- Linux: esegui lo script di installazione ufficiale in una riga: curl -fsSL https://ollama.com/install.sh | sh.
- Verifica l'installazione: apri un terminale e digita ollama --version.
- Scarica il tuo primo modello: esegui ollama pull llama3 per scaricare Llama 3 di Meta.
- Inizia a chattare: esegui ollama run llama3 e digita il tuo primo prompt.
6. La libreria di modelli Ollama: come scegliere quello giusto
Ogni modello è a un solo ollama pull di distanza. Tra le opzioni generaliste più diffuse troviamo Llama 3, Mistral, Gemma 2, Phi-3 e Qwen 2.5. Per lavori più specifici, ci sono modelli dedicati alla programmazione come CodeLlama e DeepSeek-Coder, modelli di visione e multimodali come LLaVA e Moondream, e modelli di embedding come Nomic-Embed-Text per le pipeline RAG.
Una regola pratica per dimensionare le risorse: il numero di parametri del modello moltiplicato per circa 0,6 GB ti dà la VRAM minima necessaria. I livelli di quantizzazione (Q4, Q5, Q8) ti permettono di bilanciare precisione e consumo di risorse: Q4 è il più leggero, Q8 quello più fedele ai pesi originali.
Per dare un'occhiata a tutto quello che c'è a disposizione, visita ollama.com/library, dove trovi l'elenco completo dei modelli disponibili, con tag e varianti di dimensione.
7. I comandi essenziali della CLI di Ollama
La CLI di Ollama rende semplice la gestione dei modelli con una manciata di comandi intuitivi.
Comando | Cosa fa |
|---|---|
ollama pull <model> | Scarica un modello dalla libreria |
ollama run <model> | Avvia una sessione di chat interattiva |
ollama list | Mostra tutti i modelli installati localmente |
ollama rm <model> | Elimina un modello dal disco |
ollama show <model> | Mostra i metadati e i parametri del modello |
ollama serve | Avvia manualmente il server API di Ollama |
ollama create | Crea un modello personalizzato a partire da un Modelfile |
Puoi anche passare l'input direttamente a un modello con una pipe: echo "Explain REST APIs" | ollama run mistral. E per visualizzare statistiche sulle prestazioni, come la velocità dei token, aggiungi il flag: ollama run <model> --verbose.
8. Integrazioni popolari ed ecosistema
Integrazione LangChain Ollama
Ollama è supportato nativamente in LangChain tramite il pacchetto langchain-ollama, che permette di creare catene LLM locali, agenti e pipeline RAG senza alcuna dipendenza dal cloud. Un import tipico è from langchain_ollama import OllamaLLM.
API Python di Ollama
La libreria Python ollama (pip install ollama) rispecchia le funzionalità dell'API REST ed è perfetta per scripting e automazione. Una chiamata di base è: import ollama; response = ollama.chat(model='llama3', messages=[...]).
Altre integrazioni degne di nota
- LlamaIndex: indicizzazione e recupero di documenti con embedding locali.
- Open WebUI: un'interfaccia di chat basata su browser, simile a ChatGPT, che si collega al tuo server Ollama locale.
- Continue (plugin per VS Code / JetBrains): un assistente di coding AI alimentato da un modello Ollama locale.
- AnythingLLM: un workspace RAG no-code che usa Ollama come backend di inferenza.
9. Privacy e sicurezza dei dati con Ollama
La garanzia di privacy alla base di tutto è semplice: l'inferenza avviene interamente sul dispositivo, quindi i tuoi prompt e le risposte non lasciano mai la macchina locale. Non c'è alcuna telemetria, non serve un account e non ti leghi a nessun fornitore.
Questo rende Ollama perfetto per gestire materiale sensibile come cartelle cliniche, documenti legali, codice sorgente proprietario e dati aziendali riservati. Aiuta anche i team a rispettare il GDPR, l'HIPAA e le politiche interne di governance dei dati. Da tenere a mente: anche i modelli open-weight usati tramite un'API cloud espongono comunque i tuoi dati al provider, mentre la privacy dell'AI locale elimina completamente questo rischio.
10. Casi d'uso reali e applicazioni pratiche
- Assistente di coding AI: esegui CodeLlama o DeepSeek-Coder in locale dentro VS Code tramite il plugin Continue.
- Pipeline RAG: combina Ollama con un database vettoriale come Chroma o Qdrant per fare domande sui tuoi documenti privati.
- Assistente AI offline: usa Ollama sul portatile mentre viaggi, in ambienti isolati dalla rete, o ovunque la connessione non sia affidabile.
- Agenti AI locali: crea agenti autonomi per l'esecuzione di task con LangChain o AutoGen, usando un modello locale come motore.
- Formazione e sperimentazione: un ambiente sicuro dove testare prompt, studiare il comportamento dei modelli e capire i meccanismi degli LLM senza brutte sorprese in bolletta.
11. Limiti di Ollama
- Il limite è l'hardware: le prestazioni dipendono dalla VRAM della tua GPU locale, e i modelli molto grandi (70B e oltre) richiedono GPU consumer top di gamma o da workstation.
- Nessuna interfaccia integrata: Ollama di per sé è solo CLI e API, quindi ti serve uno strumento a parte come Open WebUI per avere una chat.
- Il gap di qualità dei modelli: anche i migliori LLM open source possono restare indietro rispetto ai modelli di punta come GPT-4o e Claude 3.5 Sonnet nel ragionamento complesso.
- Download iniziale pesante: i modelli sono file grandi (da 2 a 40 GB), il che rende l'avvio lento con connessioni limitate.
- Il supporto Windows è ancora acerbo: alcune funzionalità di nicchia sono indietro rispetto alle implementazioni per macOS e Linux.
Usi modelli locali per risparmiare, ma paghi ancora a prezzo pieno l'AI in cloud? Con Bleap hai 0% di commissioni sul cambio valuta per gli abbonamenti in USD e un cashback fisso del 20% su Claude, ChatGPT e Gemini, senza nessun canone mensile da parte sua. Scopri la carta Bleap →
Domande frequenti (FAQ)
Ollama è gratuito?
Sì. Ollama è completamente open-source (licenza MIT) e non ha costi di utilizzo. L'unica spesa è quella per l'hardware su cui lo fai girare.
Come si confronta Ollama con ChatGPT?
Ollama esegue modelli open-source in locale, garantendo la totale privacy dei dati. ChatGPT offre un modello all'avanguardia più potente, ma elabora i tuoi dati sui server di OpenAI e ha un costo per token o tramite abbonamento.
Quali sono i requisiti minimi di sistema per usare Ollama?
Serve un sistema operativo a 64 bit moderno (macOS 13+, Windows 10/11 o Ubuntu 20.04+), almeno 8 GB di RAM e circa 5 GB di spazio libero su disco per un modello piccolo. Una GPU dedicata velocizza parecchio le prestazioni.
Posso usare Ollama senza connessione internet?
Dopo il download iniziale del modello, Ollama funziona completamente offline, diventando un vero assistente AI utilizzabile senza internet.
Come integro Ollama con Python o LangChain?
Installa il pacchetto Python ollama (pip install ollama) per chiamate API dirette, oppure usa langchain-ollama per integrare Ollama nelle chain e negli agent di LangChain come LLM locale plug-and-play.
Quali modelli di Ollama sono i migliori per la programmazione?
CodeLlama, DeepSeek-Coder-V2 e Qwen2.5-Coder sono le scelte più popolari per l'assistenza alla programmazione in locale con Ollama.
Conclusione
Ollama è un runner gratuito e open-source per large language model che rende accessibile l'inferenza AI privata anche su hardware comune. È flessibile, rispetta la privacy ed è supportato da un ecosistema di integrazioni in rapida crescita: è la soluzione ideale per sviluppatori e utenti attenti alla privacy, disposti ad accettare qualche limite di prestazioni rispetto ai modelli cloud all'avanguardia. Installalo, scarica un modello e prova subito la tua prima conversazione in locale. E qualunque strumento AI tu usi, paga in modo intelligente: con Bleap eviti le commissioni sui cambi valuta per gli abbonamenti in USD, e su Claude, ChatGPT e Gemini ottieni il 20% di cashback a ogni rinnovo.
Un modo più intelligente di spendere, inviare, guadagnare e fare trading

- Artificial Inteligence








