Wat Is Ollama? De Complete Gids voor Lokale AI-Modellen
9 August 2026 · Bijgewerkt 9 August 2026

Gabriel Caetano
ARTIFICIAL INTELIGENCE
Wat Is Ollama? De Complete Gids voor Lokale AI-Modellen
Ontdek wat Ollama is, hoe het werkt en hoe je AI-modellen lokaal draait. Leer Ollama installeren, modellen kiezen, de API en CLI gebruiken en privé-AI-workflows bouwen zonder afhankelijk te zijn van de cloud.

Wat is Ollama? De complete gids voor het lokaal draaien van AI-modellen
Ollama is een gratis, open-source tool waarmee je grote taalmodellen zoals Llama 3, Mistral en Gemma direct op je eigen computer kunt downloaden en draaien, met een lokale API-server die draait op http://localhost:11434. Het bestaat omdat niet iedereen zijn prompts naar een cloudprovider wil sturen of per token wil betalen. Dat gezegd hebbende: lokale prestaties hangen volledig af van je hardware, dus een geavanceerd cloudmodel blijft nog altijd sneller bij zware redeneertaken.
Deze gids legt uit wat Ollama is, hoe het werkt, hoe je het installeert, welke modellen je het beste kunt kiezen, en waar het van pas komt, plus de slimste manier om te betalen voor AI-abonnementen zoals Claude, ChatGPT en Gemini zonder geld te verliezen aan wisselkoerskosten.
Betaal je elke maand voor ChatGPT, Claude of Gemini? Bleap rekent 0% wisselkoerskosten op je USD-abonnementen en geeft een vaste 20% cashback op Claude, ChatGPT en Gemini, met een self-custodial Mastercard en zonder eigen abonnement. (De 20% cashback geldt alleen voor Claude, ChatGPT en Gemini.) Vraag de Bleap-kaart aan →
1. Wat is Ollama?
Ollama is een gratis, open-source tool waarmee je grote taalmodellen lokaal kunt draaien op gewone consumentenhardware. Het regelt alle vervelende klusjes voor je: het downloaden van modelgewichten, het beheren van opslag, het detecteren van je GPU en het aanbieden van een simpele interface om mee te chatten.
Ollama kwam uit in 2023 en werd al snel een van de populairste open-source LLM-tools voor mensen die AI op hun eigen voorwaarden willen gebruiken. Het idee erachter is simpel: download, beheer en chat met LLM's volledig op je eigen apparaat, zonder API-key, zonder abonnement en zonder dat je data ergens anders naartoe gaat.
Voor wie is het bedoeld? Voor solo-developers, kleine teams, onderzoekers en gebruikers die privacy voorop stellen en volledige controle willen over waar hun prompts terechtkomen en hoeveel ze uitgeven.
2. Hoe Ollama werkt
Op hoofdlijnen draait Ollama als een lokale server op je eigen machine. Het laadt de modelgewichten in het geheugen en zet een REST API op localhost op, waarmee de command line en elke gekoppelde app kunnen communiceren.
Modellen komen in een GGUF-gebaseerd gekwantiseerd formaat en haal je met één simpel commando op uit de Ollama model library. Zodra een model gedownload is, speelt de hele inferentie zich op je eigen apparaat af: je prompt gaat erin, het model verwerkt hem lokaal, en je krijgt het antwoord terug, zonder omweg naar de cloud.
Kwantisatie is hier de truc achter. Door de modelgewichten te comprimeren naar kleinere getalformaten, kunnen grote taalmodellen dankzij kwantisatie draaien op gewone consumenten-GPU's, en zelfs op machines zonder GPU, zonder dat je een datacenter nodig hebt.
Kernonderdelen van de architectuur
- Lokale API-server: luistert standaard op http://localhost:11434, zodat elke tool ermee kan verbinden.
- Opslaglaag voor modellen: modellen worden na de eerste download op schijf gecachet, zodat je ze niet steeds opnieuw hoeft te downloaden.
- Hardware-abstractie: automatische detectie van je GPU (NVIDIA CUDA, Apple Metal of AMD ROCm), met een fallback naar de CPU als er geen GPU beschikbaar is.
3. Belangrijkste functies van Ollama
- Ollama model library: een zorgvuldig samengestelde collectie van populaire open-source LLM's die je direct kunt downloaden, doorzoekbaar op naam, grootte en tag.
- Cross-platform ondersteuning: native installatieprogramma's voor macOS, Linux en Windows.
- OpenAI-compatibele API: een endpoint dat je zo kunt inpluggen, waardoor je bestaande code van cloud-API's zonder gedoe kunt migreren.
- Modelfile aanpassingen: leg systeemprompts, parameters en basismodellen vast met een eenvoudige configuratie in Dockerfile-stijl.
- Gelijktijdig modellen draaien: run meerdere modellen tegelijk (vanaf v0.5), handig voor multi-agent opstellingen.
- Lichtgewicht CLI: een intuïtieve command-line interface voor het ophalen, draaien en beheren van modellen.
4. Ollama versus AI in de cloud (ChatGPT, Claude en anderen)
Factor | Ollama (lokaal) | ChatGPT / Claude (cloud) |
|---|---|---|
Privacy | Volledig eigenaar van je data | Data wordt verwerkt op servers van de leverancier |
Kosten | Gratis na aanschaf hardware | Abonnement of kosten per token |
Latency | Afhankelijk van je lokale GPU | Laag, dankzij geoptimaliseerde datacenters |
Internet nodig | Alleen om het model te downloaden | Altijd |
Keuze uit modellen | Open-source bibliotheek | Vastgezet aan één leverancier |
Installatiemoeite | Gemiddeld | Geen |
Op het gebied van privacy blijft bij Ollama alles op je eigen apparaat, terwijl cloudtools je prompts verwerken op de infrastructuur van de leverancier. Qua kosten is Ollama gratis zodra je de hardware hebt, terwijl clouddiensten je maandelijks of per verzoek laten betalen. De cloud wint op het gebied van latency en installatiegemak, want geoptimaliseerde datacenters reageren snel en je hoeft zelf niets te installeren. Ollama wint als het gaat om keuze uit modellen: je krijgt een open bibliotheek in plaats van één model waar je aan vastzit bij één leverancier.
Kortom: Ollama wint op het gebied van privacy en kosten voor lokale AI, terwijl de cloud wint op pure prestaties en gemak zonder installatie. Het is geen vervanging voor elke toepassing, maar wel een sterke aanvulling voor privacygevoelige situaties of momenten waarop je offline wilt werken.
Betaal je nog steeds de volle prijs voor je AI-abonnement in de cloud, elke maand weer? Met Bleap betaal je voor Claude, ChatGPT en Gemini in USD tegen de echte koers, dus 0% wisselkosten, plus een vaste 20% cashback op die drie abonnementen. Vraag de Bleap-kaart aan →
5. Systeemvereisten & installatie
Systeemvereisten voor Ollama
- macOS: 13 Ventura of nieuwer; Apple Silicon (M1/M2/M3) aanbevolen, Intel wordt ook ondersteund.
- Windows: Windows 10/11 (64-bit); een NVIDIA-GPU met CUDA 11.3+ of een AMD-GPU met ROCm is optioneel, maar wel aan te raden.
- Linux: Ubuntu 20.04+ of vergelijkbaar, met dezelfde GPU-ondersteuning als bij Windows.
- RAM: minimaal 8 GB voor 7B-modellen, 16 GB aanbevolen, en 32 GB of meer voor 13B-modellen en groter.
- Schijfruimte: modellen variëren van ongeveer 2 GB (gequantiseerd 3B) tot 40 GB of meer (70B), houd hier rekening mee.
- Alleen CPU: wordt ondersteund, maar is aanzienlijk trager en kun je het beste bewaren voor kleine modellen (1B tot 3B).
Ollama installeren (stap voor stap)
- macOS / Windows: download het installatieprogramma van ollama.com, voer het uit, en Ollama start als achtergrondservice.
- Linux: voer het officiële installatiescript met één regel uit: curl -fsSL https://ollama.com/install.sh | sh.
- Installatie controleren: open een terminal en typ ollama --version.
- Download je eerste model: voer ollama pull llama3 uit om Meta's Llama 3 te downloaden.
- Begin met chatten: voer ollama run llama3 uit en typ je eerste prompt.
6. Ollama Model Library: het juiste model kiezen
Elk model is maar één ollama pull verwijderd. Populaire algemene modellen zijn Llama 3, Mistral, Gemma 2, Phi-3 en Qwen 2.5. Voor specifieke taken zijn er codeermodellen zoals CodeLlama en DeepSeek-Coder, visuele en multimodale modellen zoals LLaVA en Moondream, en embedding-modellen zoals Nomic-Embed-Text voor RAG-pipelines.
Een handige vuistregel voor de juiste grootte: het aantal parameters van een model keer ongeveer 0,6 GB geeft je de minimale VRAM die je nodig hebt. Met quantisatieniveaus (Q4, Q5, Q8) kun je nauwkeurigheid inruilen voor minder resourcegebruik, waarbij Q4 het lichtst is en Q8 het dichtst bij de originele weights blijft.
Wil je alles bekijken? Ga naar ollama.com/library, waar alle beschikbare modellen staan met tags en verschillende groottes.
7. Essentiële Ollama CLI-commando's
Met de Ollama CLI beheer je modellen eenvoudig via een handvol intuïtieve commando's.
Commando | Wat het doet |
|---|---|
ollama pull <model> | Downloadt een model uit de library |
ollama run <model> | Start een interactieve chatsessie |
ollama list | Toont alle lokaal geïnstalleerde modellen |
ollama rm <model> | Verwijdert een model van de schijf |
ollama show <model> | Laat modelmetadata en parameters zien |
ollama serve | Start de Ollama API-server handmatig |
ollama create | Bouwt een eigen model op basis van een Modelfile |
Je kunt ook rechtstreeks input naar een model sturen: echo "Explain REST APIs" | ollama run mistral. En voor prestatiestatistieken zoals tokensnelheid voeg je de vlag toe: ollama run <model> --verbose.
8. Populaire integraties & ecosysteem
LangChain Ollama-integratie
Ollama wordt native ondersteund in LangChain via het langchain-ollama package, waarmee je lokale LLM-chains, agents en RAG-pipelines kunt bouwen zonder enige cloudafhankelijkheid. Een typische import ziet er zo uit: from langchain_ollama import OllamaLLM.
Ollama Python API
De ollama Python-library (pip install ollama) volgt de REST API en is ideaal voor scripting en automatisering. Een simpele aanroep ziet er zo uit: import ollama; response = ollama.chat(model='llama3', messages=[...]).
Andere belangrijke integraties
- LlamaIndex: documentindexering en -retrieval met lokale embeddings.
- Open WebUI: een browsergebaseerde chatinterface, vergelijkbaar met ChatGPT, die verbinding maakt met jouw lokale Ollama-server.
- Continue (VS Code / JetBrains-plugin): een AI-codeerassistent die draait op een lokaal Ollama-model.
- AnythingLLM: een no-code RAG-werkomgeving die Ollama als inference-backend gebruikt.
9. Privacy & gegevensbeveiliging met Ollama
De belangrijkste privégarantie is simpel: alle inference gebeurt op je eigen apparaat, dus je prompts en antwoorden verlaten nooit de lokale machine. Er is geen telemetrie, geen account nodig en geen vendor lock-in.
Dat maakt Ollama uitermate geschikt voor gevoelig materiaal zoals medische notities, juridische documenten, eigen broncode en vertrouwelijke bedrijfsgegevens. Het helpt teams ook om te voldoen aan de AVG (GDPR), HIPAA en interne richtlijnen voor gegevensbeheer. Goed om te onthouden: zelfs open-weight modellen die je via een cloud-API benadert, geven je gegevens alsnog door aan die provider, terwijl lokale AI-privacy dat risico volledig wegneemt.
10. Praktijkvoorbeelden & toepassingen
- AI-codeerassistent: draai CodeLlama of DeepSeek-Coder lokaal in VS Code via de Continue-plugin.
- RAG-pipelines: combineer Ollama met een vectordatabase zoals Chroma of Qdrant voor privé Q&A op basis van documenten.
- Offline AI-assistent: gebruik Ollama op je laptop tijdens het reizen, in air-gapped omgevingen, of overal waar je internetverbinding onbetrouwbaar is.
- Lokale AI-agents: bouw autonome taakagents met LangChain of AutoGen, met een lokaal model als basis.
- Onderwijs & experimenteren: een veilige sandbox om prompts te testen, modelgedrag te bestuderen en de werking van LLM's te leren begrijpen, zonder verrassingen op je rekening.
11. Beperkingen van Ollama
- Hardwareplafond: de prestaties worden begrensd door het VRAM van je lokale GPU, en heel grote modellen (70B en hoger) vragen om high-end consumenten- of workstation-GPU's.
- Geen ingebouwde interface: Ollama zelf werkt alleen via CLI en API, dus voor een chatinterface heb je een aparte tool nodig, zoals Open WebUI.
- Kwaliteitsverschil met topmodellen: zelfs de beste open-source LLM's kunnen achterblijven bij frontier-modellen als GPT-4o en Claude 3.5 Sonnet als het om complexe redenering gaat.
- Grote initiële download: modellen zijn grote bestanden (2 tot 40 GB), waardoor het opstarten traag verloopt bij een beperkte internetverbinding.
- Windows-ondersteuning nog in ontwikkeling: sommige randgevallen lopen nog achter op de macOS- en Linux-versies.
Draai je lokale modellen om geld te besparen, maar betaal je nog steeds de volle prijs voor cloud-AI? Met Bleap betaal je 0% wisselkoerskosten op USD-abonnementen en krijg je een vaste cashback van 20% op Claude, ChatGPT en Gemini, zonder eigen maandelijks abonnement. Vraag de Bleap-kaart aan →
Veelgestelde vragen (FAQ)
Is Ollama gratis te gebruiken?
Ja. Ollama is volledig open-source (MIT-licentie) en er zijn geen gebruikskosten. Je betaalt alleen voor de hardware waarop je het draait.
Hoe verhoudt Ollama zich tot ChatGPT?
Ollama draait open-source modellen lokaal, met volledige privacy van je gegevens. ChatGPT biedt een krachtiger topmodel, maar verwerkt je data op de servers van OpenAI en rekent per token of via een abonnement.
Wat zijn de minimale systeemvereisten om Ollama te draaien?
Een modern 64-bits besturingssysteem (macOS 13+, Windows 10/11 of Ubuntu 20.04+), minimaal 8 GB RAM en ongeveer 5 GB vrije schijfruimte voor een klein model. Een dedicated GPU versnelt de prestaties aanzienlijk.
Kan ik Ollama zonder internetverbinding gebruiken?
Na het downloaden van het model werkt Ollama volledig offline, waardoor het een echte offline AI-assistent is.
Hoe integreer ik Ollama met Python of LangChain?
Installeer het ollama Python-pakket (pip install ollama) voor directe API-calls, of gebruik langchain-ollama om Ollama als kant-en-klare lokale LLM in te pluggen in LangChain-chains en -agents.
Welke Ollama-modellen zijn het best voor codeertaken?
CodeLlama, DeepSeek-Coder-V2 en Qwen2.5-Coder zijn de populairste keuzes voor lokale codeerondersteuning via Ollama.
Conclusie
Ollama is een gratis, open-source large language model runner waarmee privé AI-inference toegankelijk wordt op alledaagse hardware. Het is flexibel, privacyvriendelijk en wordt ondersteund door een snelgroeiend ecosysteem aan integraties. Het is het meest geschikt voor developers en privacybewuste gebruikers die wat prestatiebeperkingen accepteren ten opzichte van cloud-topmodellen. Installeer het, haal een model binnen en voer vandaag nog je eerste lokale gesprek. En welke AI-tools je ook gebruikt, betaal slim: met Bleap ontwijk je de wisselkoerskosten op USD-abonnementen, en op Claude, ChatGPT en Gemini krijg je 20% cashback bij elke verlenging.
Een slimmere manier om te betalen, verzenden, verdienen en traden

- Artificial Inteligence








