RTX 5090 voor lokale AI: is NVIDIA’s krachtigste consumenten-GPU het waard in 2026?
27 August 2026 · Bijgewerkt 27 August 2026

Gabriel Caetano
ARTIFICIAL INTELIGENCE
RTX 5090 voor lokale AI: is NVIDIA’s krachtigste consumenten-GPU het waard in 2026?
Is de RTX 5090 het waard voor lokale AI? Ontdek de 32 GB GDDR7-VRAM, LLM-prestaties, benchmarks en beperkingen en hoe hij zich verhoudt tot de RTX 4090 en Apple Silicon.

RTX 5090 voor lokale AI: is NVIDIA's krachtigste consumenten-GPU de investering waard in 2026?
De RTX 5090 is in 2026 de sterkste losse consumenten-GPU voor lokale AI, dankzij 32 GB GDDR7-geheugen en een bandbreedte van zo'n 1.792 GB/s die real-world inferentie naar ongeveer 180 tot 230 tokens per seconde duwt bij modellen die in het VRAM passen. Die snelheid komt van NVIDIA's Blackwell-architectuur en de native FP4-ondersteuning, een primeur voor consumentenkaarten. Toch blijft die 32 GB-grens native inferentie van 70B-modellen tegenhouden, dus het is niet automatisch de juiste keuze voor iedereen.
Je hebt het perfecte open-weight model gevonden, de weights gedownload, en toen zag je hoe je huidige GPU vastliep op het moment dat je het probeerde te laden. Die frustratie is precies waarom de keuze van je GPU in 2026 de belangrijkste beslissing is geworden voor iedereen die thuis grote taalmodellen draait. De verschuiving van cloud-afhankelijkheid naar inferentie op je eigen apparaat heeft VRAM en geheugenbandbreedte tot de metrics gemaakt die er echt toe doen, en de RTX 5090 staat precies in het middelpunt van die verschuiving.
Deze gids behandelt het complete plaatje: specificaties, realistische benchmarkwaarden, quantization-strategie, hoe hij zich verhoudt tot Apple Silicon en oudere NVIDIA-kaarten, en praktisch advies voor de installatie. Geschreven voor AI-hobbyisten, developers en prosumers die de beste GPU voor lokale AI afwegen tegen een serieus prijskaartje. Nog even iets over dat prijskaartje: een flagship GPU is een grote aankoop die vaak in Amerikaanse dollars wordt gefactureerd, en ook cloud compute-alternatieven worden in USD afgerekend, dus hoe je betaalt is belangrijker dan de meeste mensen denken. Daar komen we later op terug.
De RTX 5090 zorgt voor meer discussie dan elke GPU sinds de RTX 4090, dus laten we het beslechten met cijfers in plaats van hype.
Een GPU van $2.000 kopen of betalen voor cloud compute in USD? Een gewone kaart rekent 2 tot 3% buitenlandse transactiekosten over elke USD-transactie. Bleap rekent 0% wisselkoerskosten en geeft tot 20% cashback op je uitgaven, zonder maandelijks abonnement. Vraag de Bleap-kaart aan →
1. RTX 5090 overzicht: wat maakt hem het vlaggenschip voor lokale AI?
De RTX 5090 is de topkaart in NVIDIA's Blackwell-consumentenlijn van 2026, boven de RTX 5080 en de rest van de RTX 50-serie. Het is het pronkstuk, gebouwd voor mensen die maximale prestaties uit één GPU willen halen zonder de prijzen van datacenterhardware te betalen.
Lokale AI-inferentie is de afgelopen twee jaar drastisch veranderd. In plaats van per verzoek te betalen voor een cloud-API, draaien steeds meer developers en hobbyisten open-weight modellen rechtstreeks op hun eigen hardware, voor privacy, kostenbeheersing en offline toegang. Die verschuiving maakt de GPU bepalend voor wat je daadwerkelijk kunt draaien.
Blackwell is de motor achter de 5090. Belangrijke kenmerken zijn de grote GB202-die, 5e generatie Tensor Cores, native FP4-inferentie-ondersteuning en DLSS 4 Multi-Frame Generation aan de gaming-kant. Specifiek voor AI zijn het de FP4-hardwarepad en het vernieuwde geheugensysteem die er het meest toe doen.
Vergeleken met de Ada Lovelace RTX 4090 is de generatiesprong niet alleen meer cores. Het is een heringericht geheugensubsysteem en Tensor Core-ontwerp die de efficiëntie voor AI-workloads verbeteren, niet alleen de ruwe doorvoersnelheid. Als je LLM's draait, adapters finetunet of lokaal afbeeldingen en video genereert, is dit de kaart die je aandacht verdient.
2. RTX 5090 volledige specificaties, modellen & prijzen
Belangrijkste technische specificaties
- GPU-die: GB202 (Blackwell)
- CUDA-cores: 21.760
- Tensor Cores: 5e generatie, met ondersteuning voor FP4, FP8, FP16 en INT8
- Boostclock: ongeveer 2,4 GHz, afhankelijk van het model
- TDP: 575 W
- PCIe-interface: PCIe 5.0 x16
- Beeldschermuitgangen: DisplayPort 2.1 en HDMI 2.1, met tweerichtings-NVLink beschikbaar op bepaalde configuraties
VRAM & geheugenconfiguratie
Het belangrijkste cijfer voor AI is het geheugen. De RTX 5090 heeft 32 GB GDDR7 op een 512-bit bus, wat zorgt voor ongeveer 1.792 GB/s aan bandbreedte. Dat is een flinke sprong ten opzichte van de 24 GB GDDR6X van de RTX 4090 met 1.008 GB/s. De overstap van GDDR6X naar GDDR7, samen met de bredere bus, verklaart waarom de bandbreedte zo sterk toeneemt, en bandbreedte is vaak dé echte bottleneck bij LLM-decoding.
SKU's & straatprijzen
SKU | VRAM | TDP | Adviesprijs bij lancering (USD) | Geschatte Europese straatprijs |
|---|---|---|---|---|
RTX 5090 Founders Edition | 32 GB GDDR7 | 575 W | $1.999 | €2.300 tot €2.700 |
RTX 5090 AIB (OC-modellen) | 32 GB GDDR7 | 600 W+ | $2.099+ | €2.500 tot €3.100 |
De beschikbaarheid volgde het bekende patroon van een flagship-lancering: schaarste bij release, prijzen ver boven de adviesprijs door scalpers, en een geleidelijke normalisering zodra het aanbod zich herstelt. Koop je bij een internationale retailer die in dollars prijst, dan kan de valutaomrekening op je kaart stiekem nog eens 2 tot 3% extra kosten. En dat is precies waar een kaart zonder wisselkoerskosten je bij een aankoop van deze omvang écht geld bespaart.
3. VRAM & geheugenbandbreedte onder de loep voor LLM-workloads
Het VRAM-plafond van 32 GB: wat betekent dit voor lokale LLM's?
VRAM is de belangrijkste beperkende factor als je LLM's lokaal draait. Past het model plus de context niet in het geheugen, dan moet je zwaarder quantizen of alles offloaden naar systeem-RAM, wat de snelheid flink omlaag haalt.
Hier een snel overzicht van wat er in 32 GB past:
- 7B-model op FP16: ongeveer 14 GB, past zonder problemen
- 13B-model op FP16: ongeveer 26 GB, ruim voldoende
- 34B-model op Q4 of Q5: past binnen 32 GB
- 70B-model op Q4: ongeveer 35 tot 40 GB, past dus niet native en vraagt om offloading of twee GPU's
En hier komt de spanning met Apple Silicon om de hoek kijken. Een Mac met unified memory kan tot 192 GB aanspreken voor de GPU, waardoor hij modellen kan laden die de 5090 simpelweg niet kwijt kan. De 5090 ruilt maximale modelgrootte in voor veel hogere snelheid bij de modellen die er wél in passen.
Geheugenbandbreedte: de verborgen prestatiefactor
Bij autoregressieve decodering telt bandbreedte vaak zwaarder dan het pure aantal CUDA-cores. Elke gegenereerde stap moet de modelgewichten uit het geheugen lezen, dus hoe sneller je data kunt verplaatsen, hoe sneller je output produceert.
De 1.792 GB/s van de RTX 5090 tegenover de 1.008 GB/s van de RTX 4090 is een toename van 78%, en dat vertaalt zich vrijwel direct naar meer tokens per seconde bij bandbreedte-gebonden workloads. Bij sommige taken, zoals grootschalige serving of fine-tuning, wordt de rekenkracht juist de bottleneck, en daar doen de verbeteringen van de Tensor Cores het zware werk. Als je weet in welk regime jouw workload zich bevindt, weet je ook of de bandbreedte of de rekenkracht van de 5090 de grootste winst oplevert.
4. AI Benchmark-vergelijking: RTX 5090 vs. concurrerende hardware
Directe doorvoervergelijking (geschatte bandbreedtes)
Hardware | VRAM | Llama 3 8B (FP16) | Llama 3 70B (Q4) | Mistral 7B (FP16) |
|---|---|---|---|---|
RTX 5090 | 32 GB GDDR7 | ~180 tot 220 t/s | Deels (offload) | ~190 tot 230 t/s |
RTX 4090 | 24 GB GDDR6X | ~110 tot 130 t/s | Niet haalbaar | ~115 tot 135 t/s |
NVIDIA DGX H100 (ref.) | 80 GB HBM3 | 400+ t/s | 200+ t/s | 400+ t/s |
Mac Mini M4 Ultra (geschat) | 192 GB unified | ~60 tot 80 t/s | ~25 tot 40 t/s | ~65 tot 80 t/s |
AMD Ryzen AI MAX+ 395 | 96 GB unified | ~50 tot 70 t/s | ~20 tot 35 t/s | ~55 tot 70 t/s |
Let op: GPU-inferentiebenchmarks hangen af van het model, de quantisatie en de softwarestack. Deze cijfers zijn geschatte bandbreedtes op basis van architecturale schaling en vroege community-data, geen gegarandeerde resultaten.
Belangrijkste conclusies uit de vergelijking
De RTX 5090 is oppermachtig qua ruwe doorvoersnelheid bij elk model dat binnen zijn 32 GB past. Apple Silicon en geïntegreerde AMD-oplossingen winnen als het gaat om de maximale modelgrootte, omdat unified memory ze in staat stelt veel grotere modellen te draaien, zij het trager. Datacenter-hardware zoals de DGX H100 blijft buiten bereik voor consumentenbudgetten, zowel qua prijs als stroomverbruik. Voor de meeste lokale AI-gebruikers speelt de echte strijd zich af tussen de 5090 en een machine met veel unified memory.
5. Kwantisatie, FP4/FP8 & prestaties op architectuurniveau
Kwantisatiemethoden en VRAM-afwegingen
Kwantisatie | Bits per gewicht | VRAM-reductie | Impact op kwaliteit | Ondersteuning RTX 5090 |
|---|---|---|---|---|
FP16 | 16 | Uitgangspunt | Geen | Ja |
INT8 / Q8 | 8 | ~50% | Minimaal | Ja |
INT4 / Q4 | 4 | ~75% | Gemiddeld | Ja |
FP4 (native Blackwell) | 4 (float) | ~75% | Beter dan INT4 | Ja (native hardware) |
FP8 | 8 (float) | ~50% | Vrijwel zonder kwaliteitsverlies | Ja (native hardware) |
Het voordeel van Blackwell's native FP4-inferentie
De 5e generatie Tensor Cores voegt hardware-versnelde FP4 toe, een primeur voor consumenten-GPU's. Omdat FP4 een floating-point-formaat is in plaats van een simpel integer-formaat, behoudt het doorgaans meer kwaliteit dan software-INT4 bij dezelfde 4-bit footprint. In de praktijk betekent dit dat je grotere, kwalitatief betere gekwantiseerde inferentie kunt draaien met minder nauwkeurigheidsverlies dan met de 4090 mogelijk was. Om gebruik te maken van de native FP8- en FP4-paden heb je een recente CUDA-toolkit nodig, over het algemeen CUDA 12.x of nieuwer.
Belangrijkste compute-benchmarks
Op papier levert de RTX 5090 ongeveer 209 TFLOPS aan FP16-rekenkracht, tegenover circa 82 TFLOPS bij de RTX 4090, met daarbovenop flinke winst in INT8-, FP8- en FP4-tensorprestaties. In de praktijk haal je die theoretische FLOPS nooit helemaal, want geheugentoegang, kernel-efficiëntie en batching zorgen allemaal voor overhead. Toch is de richting duidelijk: Blackwell tilt AI-rekenkracht ver boven het niveau van Ada uit, zeker bij lagere precisie.
Overweeg je een 5090 tegenover maanden aan cloud API-kosten? Hoe je ook betaalt voor compute of hardware die in dollars wordt afgerekend, met Bleap betaal je 0% wisselkoerskosten en krijg je tot 20% cashback, zodat je AI-budget verder reikt. Geen maandelijks abonnement. Vraag de Bleap-kaart aan →
6. Apple Silicon vs. RTX 5090 voor grote lokale LLM's
Waar Apple Silicon (M4 Ultra / M3 Max) wint
Dankzij Apple's unified memory-architectuur kan de GPU het systeemgeheugen met volledige bandbreedte benaderen, waardoor een goed uitgeruste M4 Ultra 70B- of zelfs 100B+-modellen native kan draaien zonder agressieve quantization. Ook is het veel energiezuiniger: zo'n 150 W tegenover de 575 W van de 5090. Dat maakt nogal wat uit bij lange sessies en in stille ruimtes. Voor onderzoekers die de maximale modelgrootte op één machine nodig hebben, is dit een sterke optie.
Waar RTX 5090 + CUDA wint
De 5090 levert aanzienlijk meer tokens per seconde bij elk model dat binnen 32 GB past. Ook is het CUDA-ecosysteem volwassener, met eersteklas ondersteuning in vLLM, TensorRT-LLM, bitsandbytes en Triton. Fine-tuning en LoRA-training draaien flink sneller op de 5090 dan op Apple Silicon, en multi-GPU-scaling via NVLink vergroot de mogelijkheden nog verder. De meeste AI-frameworks worden eerst voor CUDA geoptimaliseerd, waardoor compatibiliteitsproblemen minder vaak voorkomen.
Het oordeel voor verschillende gebruikers
Een hobbyist die dagelijks Llama 3 70B draait, zal waarschijnlijk blijer zijn met een M4 Ultra en zijn enorme geheugenpool. Een developer die fine-tuning en inference doet op modellen van 7B tot 34B haalt meer uit de RTX 5090. Beide bezitten is het beste van twee werelden, maar het is duur en voor de meeste mensen niet nodig.
7. Vereisten voor lokale AI-workloads: welke GPU past bij jouw gebruik
Inference vs. fine-tuning vs. training
Workload | VRAM-behoefte | Rekenkracht-behoefte | Geschiktheid RTX 5090 |
|---|---|---|---|
Inference (7B tot 13B) | Laag tot gemiddeld | Gemiddeld | Uitstekend |
Inference (34B Q4) | Gemiddeld tot hoog | Gemiddeld | Zeer goed |
Inference (70B Q4) | Te groot (offloading nodig) | Hoog | Beperkt |
LoRA fine-tuning (7B) | ~16 tot 20 GB | Zeer hoog | Uitstekend |
LoRA fine-tuning (13B) | ~24 tot 30 GB | Zeer hoog | Goed |
Volledige fine-tuning (7B) | ~60 GB+ | Extreem | Niet haalbaar solo |
Beeld/video diffusion | ~8 tot 16 GB | Hoog | Uitstekend |
Minimale VRAM-richtlijnen per modelgrootte
- Modellen onder 7B: minimaal 8 GB, 16 GB aanbevolen
- Modellen van 7B tot 13B: minimaal 16 GB, 24 GB aanbevolen
- 34B-modellen: 24 GB bij Q4, 48 GB bij FP16
- 70B-modellen: 48 GB bij Q4, 80 GB of meer bij FP16, dat gaat de RTX 5090 te boven
Het patroon is duidelijk: de 5090 is uitstekend voor inference tot 34B en voor LoRA fine-tuning op kleinere modellen, maar volledige fine-tuning en native 70B-werk vragen meer dan één kaart aankan.
8. Concurrerende alternatieven: hoe verhoudt de RTX 5090 zich tot de rest?
Snelle vergelijkingstabel
GPU | VRAM | Bandbreedte | AI-prestaties | Prijs | Beste voor |
|---|---|---|---|---|---|
RTX 5090 | 32 GB GDDR7 | 1.792 GB/s | ★★★★★ | ~€2.300+ | Topklasse lokale AI |
RTX 4090 | 24 GB GDDR6X | 1.008 GB/s | ★★★★☆ | ~€1.500 tot €1.800 | Bewezen en verkrijgbaar |
RTX 5080 | 16 GB GDDR7 | ~960 GB/s | ★★★☆☆ | ~€1.000 | Middenklasse AI |
AMD RX 9070 XT | 16 GB GDDR6 | ~640 GB/s | ★★☆☆☆ | ~€550 | Budget rasterization |
Intel Arc B580 | 12 GB GDDR6 | ~456 GB/s | ★★☆☆☆ | ~€250 | Instap-AI, beperkt |
RTX 5090 vs. RTX 4090: is de upgrade het waard?
Bij bandbreedte-gebonden inferentie mag je zo'n 65 tot 80% meer tokens per seconde verwachten van de 5090. De VRAM-sprong van 24 GB naar 32 GB maakt grotere modelklassen mogelijk, vooral 34B-modellen met hogere quantisatie. De keerzijde is de prijs: de 5090 kost doorgaans €400 tot €600 meer dan de huidige 4090-prijzen. Loop je nu al tegen de VRAM-limieten van de 4090 aan, dan is de upgrade zeker de moeite waard. Kun je prima uit de voeten met 24 GB, dan blijft de 4090 een prima keuze qua prijs-kwaliteit.
Kanttekeningen bij AMD RX 9070 XT & Intel Arc B580
Zowel AMD als Intel zijn qua prijs aantrekkelijk, maar de ROCm- en oneAPI-ecosystemen lopen nog achter op CUDA als het gaat om compatibiliteit en tooling. Ze zijn geschikt voor budgetgebruikers die kleinere modellen draaien, maar worden afgeraden voor serieuze LLM-finetuningtaken, waar softwareproblemen je zomaar dagen kunnen kosten.
9. Voeding, koeling & systeemeisen
PSU en stroomvoorziening
Reken op een voeding van minimaal 1.000 W, en 1.200 W als je wat extra marge wilt bij volledige systeembelasting. De kaart gebruikt de 16-pins 12VHPWR-connector, dus zorg dat de kabel goed vastzit en vermijd scherpe bochten vlak bij de stekker. Piekbelasting bij AI-workloads kan tijdelijk boven de opgegeven TDP uitkomen, wat nog een reden is om geen marginale voeding te gebruiken.
Thermische overwegingen
De Founders Edition heeft een compacte triple-slot koeler, terwijl AIB-modellen vaak formaat inruilen voor stillere werking, wat goed uitkomt voor workstation-omgevingen met langdurige AI-belasting. Een full-tower behuizing met goede luchtstroom heeft de voorkeur. Probeer de junction-temperatuur onder de 83°C te houden voor een lange levensduur.
PCIe & moederbordvereisten
Een PCIe 5.0 x16-slot is ideaal, maar de kaart is achterwaarts compatibel met PCIe 4.0. Specifiek voor inference is het verschil tussen PCIe 4.0 en 5.0 minimaal, omdat de gewichten in het VRAM staan en de bus tijdens het decoderen niet de bottleneck vormt.
10. Optimalisatie- en instaltips voor lokale AI op de RTX 5090
Aanbevolen softwarestack
- Ollama: de makkelijkste instap voor lokale LLM's, met RTX 5090 CUDA-ondersteuning die direct werkt
- llama.cpp: sterk geoptimaliseerde C++-inferentie met uitstekende quantization-ondersteuning en een krachtige CUDA-backend
- vLLM: inferentieserver van productiekwaliteit, ideaal voor API-gebruik met hoge doorvoer
- TensorRT-LLM: NVIDIA's eigen framework, dat native FP8- en FP4-Blackwell-prestaties ontsluit
- bitsandbytes: quantization-library voor fine-tuning workflows
Quantization-strategie voor 32 GB VRAM
- Gebruik FP16 voor modellen van 7B tot 13B voor de beste kwaliteit, met ruimte over
- Gebruik Q5 of Q8 voor 34B-modellen om kwaliteit en 32 GB-limiet in balans te houden
- Gebruik Q4 of FP4 als je de grenzen opzoekt, met een bescheiden kwaliteitsverlies voor grotere modellen
- Vermijd CPU-offloading waar mogelijk, want dat ondermijnt het hele idee van een snelle GPU
CUDA-tuningtips
Zorg dat je CUDA 12.4 of nieuwer gebruikt en een recente NVIDIA-driver voor volledige Blackwell-ondersteuning. Zet de persistent mode aan om de inferentielatency bij lange sessies te verlagen, en houd VRAM-druk en temperaturen in de gaten met nvidia-smi en nvitop.
11. Toekomstbestendigheid & Multi-GPU-overwegingen
NVLink en Multi-GPU-schaalbaarheid
Met NVLink kunnen twee RTX 5090's hun geheugen samenvoegen tot effectief 64 GB, genoeg om native 70B FP16 inference te draaien – een flinke stap vooruit ten opzichte van één kaart. De brug zelf kost er maar een klein beetje extra bij. De softwareondersteuning zit goed dicht bij vLLM en TensorRT-LLM, terwijl multi-GPU-ondersteuning in llama.cpp nog steeds volwassener wordt.
Wanneer je beter voor de cloud kunt kiezen
Voor trainingsruns boven de 34B parameters blijft het huren van A100- of H100-instances vaak praktischer dan zelf hardware kopen. Ook als je maar af en toe gebruikmaakt van zware compute, kan het per-uur-tarief van de cloud goedkoper uitpakken dan een investering van 2.000 euro of meer. Wie dagelijks intensief gebruikmaakt van inference, verdient een eigen kaart daarentegen doorgaans binnen 12 tot 18 maanden terug in vergelijking met de cloud. Maak je toch gebruik van cloud-instances, hou er dan rekening mee dat deze meestal in USD worden gefactureerd, betaal je met een kaart zonder wisselkosten in plaats van de gangbare 2 tot 3%, dan blijven die terugkerende kosten flink lager.
De RTX 5090 als langetermijninvestering
Gezien de huidige schaaltrends bij LLM's zou 32 GB VRAM concurrerend moeten blijven tot en met de modelgeneraties van 2026 en 2027. De FP4-ondersteuning van Blackwell sluit ook goed aan bij de richting die volgende generaties gekwantiseerde modellen op lijken te gaan, en NVIDIA's topmodellen behouden historisch gezien een sterke restwaarde.
Lopen je cloud compute-rekeningen elke maand op in dollars? Bleap rekent 0% wisselkosten op uitgaven in USD en geeft tot 20% cashback terug, zonder eigen abonnement en met volledige self-custody over je geld. Vraag de Bleap-kaart aan →
FAQ: RTX 5090 voor lokale AI: veelgestelde vragen beantwoord
Hoeveel VRAM heeft de RTX 5090 en is dat genoeg voor lokale LLM's?
De RTX 5090 heeft 32 GB GDDR7. Dat is ruim voldoende voor modellen van 7B tot 34B, of je nu FP16, Q8 of Q4 quantisatie gebruikt. Een 70B-model vereist Q4-quantisatie en komt dan alsnog uit op zo'n 35 tot 40 GB, dus dat past er niet standaard bij en vraagt om CPU-offload of een tweede GPU.
Hoe verhoudt de RTX 5090 zich tot de RTX 4090 voor lokale AI-workloads?
Reken op zo'n 65 tot 80% meer tokens per seconde bij bandbreedte-gebonden inference, dankzij de sprong van 1.008 GB/s naar ongeveer 1.792 GB/s. Je krijgt er ook 8 GB VRAM bij, van 24 GB naar 32 GB, voor een meerprijs van zo'n €400 tot €600. Dat is het waard als je nu al tegen de VRAM-limiet van de 4090 aanloopt of sneller wilt fine-tunen.
Wat is de beste softwarestack om LLM's op de RTX 5090 te draaien?
Begin met Ollama als je nieuw bent, want dat regelt de CUDA-setup automatisch voor je. Gebruik llama.cpp voor sterk geoptimaliseerde gequantiseerde inference, vLLM voor API-serving en hoge doorvoer, en TensorRT-LLM als je gebruik wilt maken van de native FP8- en FP4-prestaties van Blackwell. Voeg bitsandbytes toe voor fine-tuning workflows.
Is de RTX 5090 het waard voor lokale AI in 2026?
Als je inference draait op modellen tot 34B, adapters fine-tunet, of lokaal afbeeldingen en video genereert, is de RTX 5090 de sterkste single consumentenkaart die er is. Ligt je prioriteit bij het native draaien van modellen van 70B en groter, dan kom je waarschijnlijk beter uit met een Apple Silicon-machine met veel geheugen of een dual-GPU-opstelling.
Kan de RTX 5090 70B-modellen draaien?
Niet native op Q4 met één kaart, want dan overschrijdt het geheugengebruik de 32 GB. Je kunt 70B draaien met CPU-offloading, maar dan wel met lagere snelheid, of je combineert twee RTX 5090's via NVLink tot 64 GB effectief VRAM, waarmee native 70B-inference wél mogelijk wordt.
De conclusie
De RTX 5090 is in 2026 de duidelijkste keuze voor developers en serieuze hobbyisten die topprestaties willen bij lokale inference en snel fine-tunen van modellen die binnen 32 GB passen. Je ruilt maximale modelgrootte in voor pure snelheid, en voor de meeste lokale AI-workloads is dat de juiste keuze.
Hoe je je rig ook bouwt, betaal slim. Of je de kaart nu koopt bij een internationale retailer of cloud compute huurt in dollars, met Bleap betaal je 0% wisselkoerskosten in plaats van de gebruikelijke 2 tot 3% aan buitenlandse transactiekosten, plus tot 20% cashback op je uitgaven. Het is een selfcustodial Mastercard die je overal kunt gebruiken waar Mastercard wordt geaccepteerd, zonder maandelijks abonnement, zo gaat het geld dat je bespaart op de GPU nog verder.
Een slimmere manier om te betalen, verzenden, verdienen en traden

- Artificial Inteligence








