Kom je in de buurt van AI die je zelf draait, dan duikt het woord CUDA vrijwel meteen op. Het is de technologie waarmee AI-berekeningen op een grafische kaart (GPU) van NVIDIA draaien. In dit artikel leggen we uit wat CUDA is, waarom AI zo verslaafd is aan GPU's, en wat dat betekent als je zelf iets wilt draaien.
Wat CUDA dan is
Een GPU kan het zware rekenwerk van AI aan, maar programmeurs moeten hem kunnen aansturen. CUDA is het platform van NVIDIA waarmee software de rekenkracht van een NVIDIA-GPU kan gebruiken voor algemene berekeningen, niet alleen graphics.
Vrijwel alle bekende AI-software (zoals PyTorch en TensorFlow) gebruikt CUDA onder water om berekeningen naar de GPU te sturen. Als je een AI-model traint of draait op een NVIDIA-kaart, loopt dat via CUDA.
Waarom (bijna) alles NVIDIA is
CUDA werkt alleen op NVIDIA-kaarten. Maar waaróm kiezen ontwikkelaars er dan massaal voor? Omdat CUDA geen losse tool is, maar een compleet ecosysteem dat NVIDIA al meer dan vijftien jaar uitbouwt. Er zitten kant-en-klare, zwaar geoptimaliseerde bouwstenen in (bibliotheken zoals cuDNN en cuBLAS) die de moeilijkste GPU-problemen out of the box oplossen.
Dat scheelt een ontwikkelaar dagen tot weken werk: je hoeft de complexe, low-level GPU-optimalisatie niet zelf te schrijven. Frameworks als PyTorch en TensorFlow bouwen er rechtstreeks op voort, dus alles werkt meteen. Dat gemak is de echte reden dat CUDA de standaard werd.
VRAM: de echte bottleneck
Bij AI is niet zozeer de snelheid van de GPU het probleem, maar het VRAM: het geheugen op de grafische kaart. Een model moet volledig in dat geheugen passen om te kunnen draaien.
- Een klein model past in een paar gigabyte VRAM.
- Een groot model heeft tientallen gigabytes nodig, meer dan een gewone consumentenkaart heeft.
Wat betekent dit voor jou?
Je hoeft geen dure GPU te kopen om met AI te werken. Er zijn drie routes:
- Cloud-API. Je gebruikt een model via een aanbieder (OpenAI, Anthropic). Zij hebben de GPU's; jij betaalt per gebruik. Geen hardware nodig.
- Cloud-GPU huren. Wil je zelf een open model draaien maar heb je geen kaart, dan huur je per uur een GPU-machine in de cloud.
- Eigen GPU. Draai je vaak en met gevoelige data, dan kan een eigen NVIDIA-kaart lonen. Let daarbij vooral op het VRAM.
Wat je hieruit meeneemt
- Een GPU doet duizenden simpele sommen tegelijk, precies wat AI nodig heeft; een CPU is daar veel trager in.
- CUDA is NVIDIA's platform waarmee AI-software de GPU kan aansturen. Bijna alle AI-tools gebruiken het.
- Ontwikkelaars kiezen CUDA omdat het ecosysteem out of the box werkt en veel werk scheelt; het nadeel is lock-in aan NVIDIA, waardoor andere kaarten vaak minder goed of niet werken.
- VRAM (geheugen op de kaart) bepaalt vaak of een model überhaupt draait, meer nog dan de snelheid.
- Je kunt AI gebruiken zonder eigen GPU via een cloud-API; eigen hardware loont pas bij veel gebruik of gevoelige data.
Lees verder
Wil je de basis onder deze hardware nog beter snappen? Lees dan hoe werkt AI onder de motorkap en wat een LLM precies is.
Klaar met de techniek? In het volgende artikel gaan we naar de praktijk: hoe werk je zó met AI dat je er echt bruikbare resultaten uit haalt?
