Ga naar hoofdinhoud

De beste GPU-cloudproviders voor LLM-training en -inference

Ontdek de beste betaalbare GPU-providers voor het trainen, fine-tunen en serveren van LLM’s in de cloud en voor serverloze inference.
Bijgewerkt 10 aug 2026  · 10 min lezen

Verkennen met AI

Openen in ChatGPTOpenen in ClaudeOpenen in Perplexity

Data scientists, ML-engineers en LLM-engineers zijn heel verschillende types, maar de meesten van ons willen hetzelfde van infrastructuur: zo weinig mogelijk. We willen geen uren kwijt zijn aan het configureren van cloudomgevingen of het doornemen van complexe AWS-diensten. We willen op een paar knoppen klikken, een terminal of Jupyter Notebook openen, een template kiezen en beginnen met trainen, fine-tunen of het serven van een model.

De providers in deze gids zijn met dat idee gekozen. Ze bieden gebruiksvriendelijke dashboards, vooraf geconfigureerde omgevingen, notebooks, terminals, containertemplates en duidelijke setupguides; waar Jupyter niet standaard beschikbaar is, kun je het bij de meeste binnen enkele minuten installeren.

Toch bedienen ze niet allemaal dezelfde gebruiker. Sommige zijn marktplaatsen rond prijs en hardwarekeuze; andere bieden voorspelbare virtuele machines, serverloze GPU-uitvoering, managed inference of enterprise-schaal clusters voor gedistribueerde training. We vergelijken er tien in vier categorieën: GPU-marktplaatsen en flexibele capaciteitsnetwerken, selfservice AI GPU-clouds, AI-clouds op enterpriseschaal en developer-first, notebookvriendelijke platforms.

GPU-marktplaatsen en flexibele capaciteitsnetwerken

GPT-marktplaatsen zijn ontworpen voor flexibele toegang tot gedistribueerde GPU-capaciteit. Ze zijn handig voor experimenten, batchjobs, kortdurend fine-tunen en wanneer hardwarekeuze en kosten het meest tellen.

1. Vast.ai

Vast.ai is het platform dat ik het vaakst gebruik om een betaalbare GPU te vinden voor model serving en LLM-fine-tunen. 

De marktplaats biedt een grote selectie GPU-machines die je kunt vergelijken op hardware, VRAM, betrouwbaarheid, locatie en prijs. Elke aanbieding splitst de compute- en opslagkosten duidelijk uit, zodat je weet waar je voor betaalt.

Vast.ai website

Instances ondersteunen Jupyter Notebook, browsergebaseerde terminals, SSH en verbindingen met VS Code. Voor snelle tests geef ik vaak maar een paar cent uit voordat ik de instance uitschakel. Beschikbaarheid en betrouwbaarheid van machines kunnen echter variëren omdat de hardware van verschillende marktplaatshosts komt.

Beste voor: Betaalbaar experimenteren, model serving, LoRA-fine-tunen en batch-inference.

2. RunPod

RunPod is mijn favoriete GPU-platform, en ik heb er honderden dollars aan besteed voor LLM-fine-tunen en -inference. 

Het is sneller en makkelijker te gebruiken dan Vast.ai, al kunnen goede machines duur uitpakken als je compute- en opslagkosten meerekent. RunPod werkt vrijwel perfect out-of-the-box, met kant-en-klare templates, JupyterLab, een webterminal, SSH en integratie met VS Code.

Runpod Website

Mijn enige recente probleem was GPU-beschikbaarheid. Populaire machines zijn soms niet beschikbaar, waardoor ik moet wachten of een duurdere optie moet kiezen. Desondanks blijft RunPod een van de beste platforms voor data scientists die modellen willen trainen of serven zonder complexe cloudinfrastructuur te hoeven leren.

Ik heb RunPod gebruikt in twee van onze recente tutorials, DiffusionGemma fine-tunen voor biomedische QA en Gemma 4 fine-tunen, die allebei van start tot finish op één enkele RunPod GPU-pod draaien.

Beste voor: Beginners, data scientists, LLM-fine-tunen, model serving en iedereen die een GPU-omgeving wil die gewoon werkt.

3. Spheron Network

Spheron is een goede optie voor toegang tot betaalbare, high-end GPU’s zonder gedoe met AWS of langlopende contracten. 

Het brengt GPU-capaciteit van meerdere datacenterproviders samen in één dashboard, met VM- en bare-metal-machines, volledige root-SSH-toegang, transparante prijzen en per-minuutfacturatie.

Spheron Network website

Het biedt alles van RTX 4090- en A100-machines tot H100-, H200- en B200-GPU’s. Voor grotere workloads kun je ook multi-GPU- en multi-nodeclusters inzetten met NVLink-, InfiniBand- of RoCE-netwerken. Het is iets meer infrastructuurgericht dan RunPod, maar het geeft serieuze LLM-teams veel meer flexibiliteit voor gedistribueerde training.

Beste voor: Betaalbare high-end GPU’s, LLM-training met meerdere GPU’s, gedistribueerde workloads en teams die VM- of bare-metal-toegang nodig hebben.

4. TensorDock

TensorDock is een betaalbare GPU-marktplaats voor het starten van complete virtuele machines. 

Je kiest je GPU, CPU, RAM, opslag, locatie en besturingssysteem, en je krijgt een machine met roottoegang. Het biedt een enorme reeks hardware, van goedkopere consumentenkaarten tot krachtige A100- en H100-machines.

image6.png

Het is niet zo kant-en-klaar als RunPod. Meestal maak je verbinding via SSH en configureer je je eigen omgeving, al is Docker inbegrepen bij de VM-templates en kan Jupyter worden opgezet via de beschikbare poorten. Dit geeft je meer controle, maar je moet je prettig voelen bij het installeren en beheren van je eigen tools.

Beste voor: Betaalbare GPU-virtuele machines, aangepaste PyTorch-training en zelfbeheerde vLLM- of TGI-deployments.

Selfservice AI GPU-clouds

Deze platforms lijken minder op open marktplaatsen en meer op het huren van een echte cloudmachine. Je kiest de GPU, start een VM, maakt verbinding via SSH of VS Code en creëert je eigen omgeving voor training, fine-tunen of model serving.

5. Hyperstack

Hyperstack geeft je voorspelbare GPU-infrastructuur zonder je te dwingen in AWS, Azure of een ingewikkeld enterprisecontract. 

Je kiest de GPU-configuratie, regio, OS-image en SSH-sleutel en start vervolgens binnen enkele minuten een volledige virtuele machine. Het biedt on-demand-, spot- en gereserveerde capaciteit in meerdere datacenterregio’s.

Hyperstack website

Het is een goede optie wanneer je een betrouwbare machine wilt voor een langere trainingsjob of zelfbeheerde inferencedeployment. Je moet nog steeds je omgeving configureren, maar de ervaring is veel eenvoudiger dan alles opbouwen via een traditionele hyperscaler.

Beste voor: Voorspelbare GPU-VM’s, langlopende trainingsjobs, aangepaste omgevingen en zelfbeheerde model serving.

6. Hyperbolic

Ik heb honderden dollars uitgegeven op Hyperbolic, en ik gebruik het nog steeds graag. Voor mij is het vaak een van de snelste en goedkoopste manieren geweest om high-end GPU’s te gebruiken. De machines zijn betrouwbaar, starten snel op en ik kan rechtstreeks via VS Code verbinden, waardoor de hele ervaring bijna aanvoelt als lokaal werken.

Hyperbolic website

Hyperbolic biedt on-demand GPU-instances, gereserveerde clusters, private-cloudinfrastructuur en een OpenAI-compatibele inference-API. Dit betekent dat je het kunt gebruiken voor een snel fine-tune-experiment en later kunt overstappen op dedicated capaciteit of managed inference zonder van platform te wisselen.

Mijn grootste probleem is beschikbaarheid. Het was vroeger veel makkelijker om betaalbare losse H100- of A100-machines te vinden. De laatste tijd zijn die goedkopere opties vaak niet beschikbaar als ik ze nodig heb. Ik vind misschien een enkele H200, maar veel beschikbare configuraties zijn 4x- of 8x-GPU-clusters, die veel te duur en krachtig zijn voor mijn normale workload.

Beste voor: Betaalbare high-end GPU-compute, LLM-fine-tunen, VS Code-gebruikers, managed inference en teams die later gereserveerde clusters nodig kunnen hebben.

AI-clouds op enterpriseschaal

Deze providers zijn voor serieuze AI-workloads. We hebben het over dedicated GPU-clusters, highspeed-netwerken, schaalbare opslag, gereserveerde capaciteit en infrastructuur die maandenlang betrouwbaar kan draaien in plaats van een paar uur.

7. Nebius

Ik ben fan van Nebius. Ik heb vooral de Token Factory gebruikt voor inference, en die is snel, betrouwbaar en extreem eenvoudig te gebruiken via de OpenAI-compatibele API. Je krijgt toegang tot meer dan 60 open modellen zonder de onderliggende infrastructuur te hoeven beheren.

Nebius website

Ik ben pas recent de GPU-cloudkant gaan verkennen, en die is al net zo indrukwekkend. Je kunt individuele GPU-machines starten of langlopende clusters bouwen met managed Kubernetes, opslag en highspeed-netwerken. Nebius biedt ook kortingen als je grote clusters voor meerdere maanden reserveert. 

Dit is niet alleen een platform voor kleine experimenten. Grote bedrijven gebruiken het al voor serieuze workloads. Zo draait Revolut training en inference op meer dan 200 NVIDIA H100-GPU’s op Nebius, terwijl Recraft zijn model met 20 miljard parameters via het platform heeft getraind.

Beste voor: Betrouwbare inference, langlopende GPU-clusters, gedistribueerde training, managed Kubernetes en AI-workloads op productieschaal.

8. Together AI

Together AI is veel meer dan een inference-API. Het biedt managed inference, fine-tunen, dedicated endpoints en selfservice GPU-clusters op één platform. Je kunt open-weight modellen trainen, aanpassen en deployen zonder tussen verschillende providers te hoeven wisselen.

Together AI website

De GPU-clusters bevatten high-end hardware zoals H100-, H200-, B200- en GB200-GPU’s, met InfiniBand-netwerken, persistente opslag en ondersteuning voor Kubernetes en Slurm. Clusters kunnen on-demand worden gestart of gereserveerd voor langere workloads. 

Dit is waarschijnlijk te veel voor iemand die slechts één betaalbare GPU nodig heeft voor een snel experiment. Maar het is heel logisch voor bedrijven die betrouwbare infrastructuur willen voor trainen, fine-tunen en modellen op schaal serven.

Beste voor: Enterprise GPU-clusters, grootschalige modeltraining, managed fine-tunen, dedicated inference en bedrijven die AI-systemen in productie bouwen.

Developer-first en notebookvriendelijke platforms

Deze platforms zijn gebouwd voor developers die zich op hun code willen richten in plaats van uren te besteden aan het beheren van cloudinfrastructuur. Ze bieden vertrouwde tools zoals notebooks en VS Code en regelen een groot deel van de GPU-provisioning achter de schermen.

9. Modal

Modal is helemaal anders dan het huren van een normale GPU-machine. Je schrijft Python-code, kiest de GPU die je nodig hebt en Modal draait het binnen een serverloze container. Het kan automatisch schalen van nul naar meerdere GPU’s, en je wordt afgerekend op basis van de tijd dat je code de resources daadwerkelijk gebruikt. 

Modal Website

Het is ideaal voor het deployen van inference-API’s, het draaien van evaluatiepipelines, het fine-tunen van modellen en het afhandelen van workloads die plotseling meer GPU’s nodig hebben. Modal biedt ook GPU-notebooks die binnen seconden starten, aangepaste omgevingen ondersteunen en tot acht A100- of H100-GPU’s kunnen gebruiken. 

Het enige om te begrijpen is dat Modal een andere mindset vraagt. Je opent niet simpelweg een VM en gebruikt die als een remote computer. Je definieert je infrastructuur in Python, wat in het begin ongewoon kan voelen, maar extreem krachtig wordt zodra je het doorhebt.

Beste voor: Serverloze inference, modelevaluatie, geautomatiseerde pipelines, fine-tunen en workloads die automatisch op- en af moeten schalen.

10. Thunder Compute

Thunder Compute is bijna precies wat veel data scientists willen van een GPU-cloud. Je start een machine en maakt er direct verbinding mee via VS Code, Cursor, Windsurf, de command line of Jupyter Notebook. JupyterLab is al geïnstalleerd, dus je kunt beginnen met experimenteren zonder uren kwijt te zijn aan het configureren van de omgeving. 

Thunder Compute website

Ik ben vooral gecharmeerd van het idee van de VS Code-extensie. In plaats van constant te wisselen tussen een cloud-dashboard, SSH-terminal en lokale editor, kun je de GPU-instance als een remote workspace direct in je editor aanmaken en openen. Het voelt veel meer als werken op je eigen computer, behalve dat je nu toegang hebt tot een krachtige cloud-GPU. 

Thunder Compute biedt aparte prototype- en productiemodi. Je kunt beginnen met een eenvoudige machine voor experimenten en later overstappen naar productieconfiguraties met persistente opslag en ondersteuning voor meerdere GPU’s. 

Beste voor: Jupyter-gedreven research, VS Code-gebruikers, modelexperimenten, interactief data-sciencewerk en iedereen die een krachtiger alternatief zoekt voor Google Colab.

Hoe kies je de juiste GPU-provider

Er is niet één beste GPU-provider. De juiste keuze hangt af van GPU-beschikbaarheid, prijs, gebruiksgemak, opslagkosten en of je een notebook, een VM, serverloze inference of een volledige GPU-cluster nodig hebt:

  • Kies Vast.ai, RunPod, Spheron of TensorDock wanneer je flexibele capaciteit, brede GPU-keuze en scherpe prijzen wilt.
  • Kies Hyperbolic of Hyperstack wanneer je een meer betrouwbare cloud-VM wilt voor training, notebooks of self-hosted inference.
  • Kies Nebius of Together AI wanneer je dedicated clusters, gedistribueerde training, gereserveerde capaciteit of productieschaal infrastructuur nodig hebt.
  • Kies Modal of Thunder Compute wanneer gebruiksgemak het belangrijkst is. Modal is ideaal voor serverloze workloads, terwijl Thunder Compute beter past bij vertrouwde VS Code- en Jupyter-workflows.

Tot slot

Ik gebruik vooral Vast.ai, RunPod, Hyperbolic en Modal, omdat ze gebruiksvriendelijk, flexibel en relatief betaalbaar zijn. Vast.ai is meestal mijn eerste keuze om de goedkoopste machine te vinden. RunPod is het eenvoudigste platform, Hyperbolic is snel en betrouwbaar wanneer GPU’s beschikbaar zijn, en Modal is uitstekend voor serverloze inference en geautomatiseerde workloads.

Voor heel kleine experimenten gebruik ik nog steeds Google Colab of een lokaal Jupyter Notebook. Colab is echter beperkt, vaak traag en niet iets wat ik zou aanraden voor serieus LLM-fine-tunen, model serving of langlopende trainingsjobs. 

Het beste platform is uiteindelijk het platform waarmee je snel aan de slag kunt zonder dat je een cloudinfrastructuurengineer hoeft te worden. Voor het geval je dat toch wilt worden (of wilt weten wat er achter de schermen gebeurt), raad ik aan te beginnen met onze cursus Understanding Cloud Computing.

Beste GPU-cloudproviders FAQ

Wat is de goedkoopste GPU-provider voor LLM-fine-tunen en -inference?

Marktplaatsen zoals Vast.ai en TensorDock hebben vaak de laagste uurtarieven omdat ze capaciteit van veel hosts bundelen, terwijl Spheron en Hyperbolic concurrerend blijven op high-end kaarten zoals de H100. Je totale kosten hangen af van de GPU, opslag en hoe lang de job draait, dus het laagste uurtarief is niet altijd de laagste rekening. Voor korte tests kunnen spottarieven en per-minuutfacturatie een run beperken tot een paar cent of dollars.

Heb ik een H100-GPU nodig om een large language model te fine-tunen?

Nee. Kleine en middelgrote modellen fine-tunen prima op een consumentenkaart zoals de RTX 4090 (24 GB) met LoRA of QLoRA met 4-bit quantization, wat het geheugengebruik sterk reduceert. Je hebt vooral een A100 of H100 nodig als het model te groot is om in het geheugen van een kleinere kaart te passen, of wanneer je sneller wilt trainen op een grote dataset.

Wat is het verschil tussen een GPU-marktplaats en een serverloos GPU-platform?

Een marktplaats zoals Vast.ai of TensorDock verhuurt je een volledige machine die je inricht en waar je de hele tijd voor betaalt dat hij draait, actief of idle. Een serverloos platform zoals Modal draait je code in containers die vanaf nul schalen en rekent alleen de seconden af waarin je job de GPU gebruikt. Marktplaatsen geven je meer controle en lagere uurtarieven, terwijl serverloos idle-kosten en het meeste setupwerk wegneemt.

Zijn deze GPU-cloudproviders goedkoper dan AWS, Azure of Google Cloud?

Meestal wel, vaak met ruime keuze, omdat ze GPU-verhuur aanbieden zonder de overhead van een volledige hyperscaler. Providers zoals Spheron en Hyperbolic vermelden H100-tarieven die ruim onder de prijs per GPU bij de grote clouds liggen. De keerzijde is minder managed services en, op sommige marktplaatsen, minder voorspelbare beschikbaarheid en betrouwbaarheid.

Kan ik Jupyter Notebook of VS Code gebruiken met deze GPU-providers?

Ja. De meeste providers hier ondersteunen Jupyter Notebook, een browserterminal, SSH of een VS Code-remoteverbinding, en platforms zoals RunPod en Thunder Compute brengen je daar met bijna één klik. Waar Jupyter niet vooraf is geïnstalleerd, kun je het meestal binnen enkele minuten installeren en openen.


Abid Ali Awan's photo
Author
Abid Ali Awan
LinkedIn
Twitter

Als gecertificeerd data scientist haal ik met passie het maximale uit de nieuwste technologie om innovatieve machinelearning-toepassingen te bouwen. Met een sterke achtergrond in spraakherkenning, data-analyse en -rapportage, MLOps, conversationele AI en NLP heb ik mijn vaardigheden aangescherpt in het ontwikkelen van intelligente systemen die echt impact maken. Naast mijn technische expertise ben ik ook een sterke communicator met een talent om complexe concepten terug te brengen tot heldere, beknopte taal. Daardoor ben ik uitgegroeid tot een veelgelezen blogger over data science, waar ik mijn inzichten en ervaringen deel met een groeiende community van data-professionals. Op dit moment richt ik me op contentcreatie en redactie, waarbij ik met large language models werk aan krachtige en aansprekende content die zowel bedrijven als individuen helpt het beste uit hun data te halen.

Onderwerpen

Topcursussen over de cloud

Leerpad

AWS Cloud Practitioner (CLF-C02)

10 Hr
Bereid je voor op Amazon's AWS Certified Cloud Practitioner (CLF-C02) door te leren hoe je de belangrijkste AWS-computing-, database- en opslagservices kunt gebruiken en beveiligen.
Bekijk detailsRight Arrow
Begin Met De Cursus
Meer zienRight Arrow