Cursus
Data scientists, ingénieurs ML et ingénieurs LLM ont des profils bien différents, mais nous attendons tous la même chose de l'infrastructure : le strict minimum. Nous ne voulons pas passer des heures à configurer des environnements cloud ou à naviguer dans des services AWS complexes. Nous voulons cliquer deux ou trois fois, ouvrir un terminal ou un Jupyter Notebook, choisir un modèle d'environnement et démarrer l'entraînement, l'affinage ou la mise en production d'un modèle.
Les fournisseurs de ce guide ont été sélectionnés dans cet esprit. Ils proposent des tableaux de bord conviviaux, des environnements préconfigurés, des notebooks, des terminaux, des modèles de conteneurs et des guides d'installation clairs ; là où Jupyter n'est pas disponible par défaut, la plupart permettent de l'installer en quelques minutes.
Pour autant, ils ne s'adressent pas tous au même public. Certains sont des places de marché axées sur le prix et le choix du matériel ; d'autres offrent des machines virtuelles prévisibles, de l'exécution GPU serverless, de l'inférence managée ou des clusters à l'échelle entreprise pour l'entraînement distribué. Nous en comparons dix selon quatre catégories : places de marché GPU et réseaux de capacité flexible, clouds IA en self-service, clouds IA pour l'entreprise, et plateformes conçues pour les développeurs et adaptées aux notebooks.
Places de marché GPU et réseaux de capacité flexible
Les places de marché GPU sont conçues pour un accès flexible à une capacité GPU distribuée. Elles sont utiles pour les expérimentations, les traitements batch, les affinages de courte durée et chaque fois que le choix du matériel et le coût sont déterminants.
1. Vast.ai
Vast.ai est la plateforme que j'utilise le plus souvent pour trouver un GPU abordable pour le serving de modèles et l'affinage de LLM.
Sa place de marché propose un large choix de machines GPU que vous pouvez comparer selon le matériel, la VRAM, la fiabilité, la localisation et le prix. Chaque annonce détaille clairement les coûts de calcul et de stockage, pour savoir exactement ce que vous payez.

Les instances prennent en charge Jupyter Notebook, des terminaux web, SSH et les connexions VS Code. Pour des tests rapides, je ne dépense souvent que quelques centimes avant d'éteindre l'instance. En revanche, la disponibilité et la fiabilité des machines peuvent varier, car le matériel provient de différents hôtes du marché.
Idéal pour : l'expérimentation abordable, le serving de modèles, l'affinage LoRA et l'inférence par lots.
2. RunPod
RunPod est ma plateforme GPU préférée, et j'y ai dépensé des centaines de dollars pour l'affinage et l'inférence de LLM.
Elle est plus rapide et plus simple à utiliser que Vast.ai, même si les bonnes machines peuvent revenir cher une fois les coûts de calcul et de stockage pris en compte. RunPod fonctionne quasiment parfaitement dès le départ, avec des modèles prêts à l'emploi, JupyterLab, un terminal web, SSH et une intégration VS Code.

Mon seul souci récent a été la disponibilité des GPU. Les machines populaires sont parfois indisponibles, m'obligeant à attendre ou à choisir une option plus chère. Malgré cela, RunPod reste l'une des meilleures plateformes pour les data scientists qui veulent entraîner ou déployer des modèles sans devoir apprendre une infrastructure cloud complexe.
J'ai utilisé RunPod dans deux de nos tutoriels récents, l'affinage de DiffusionGemma pour la QA biomédicale et l'affinage de Gemma 4, qui s'exécutent de bout en bout sur un seul pod GPU RunPod.
Idéal pour : les débutants, les data scientists, l'affinage de LLM, le serving de modèles et toute personne souhaitant un environnement GPU qui fonctionne tout simplement.
3. Spheron Network
Spheron est une bonne option pour accéder à des GPU haut de gamme abordables sans passer par AWS ni signer des contrats long terme.
Il agrège la capacité GPU de plusieurs fournisseurs de data centers dans un même tableau de bord, avec des VM et du bare metal, un accès root SSH complet, une tarification transparente et une facturation à la minute.

On y trouve tout, des machines RTX 4090 et A100 aux GPU H100, H200 et B200. Pour les charges plus lourdes, vous pouvez aussi déployer des clusters multi-GPU et multi-nœuds avec du réseau NVLink, InfiniBand ou RoCE. C'est un peu plus orienté infrastructure que RunPod, mais cela offre aux équipes LLM exigeantes bien plus de flexibilité pour l'entraînement distribué.
Idéal pour : des GPU haut de gamme abordables, l'entraînement LLM multi-GPU, les charges distribuées et les équipes qui ont besoin d'accès VM ou bare metal.
4. TensorDock
TensorDock est une place de marché GPU abordable pour lancer des machines virtuelles complètes.
Vous choisissez votre GPU, CPU, RAM, stockage, localisation et système d'exploitation, et vous obtenez une machine avec accès root. L'offre couvre une large gamme de matériels, des GPU grand public moins chers aux puissantes machines A100 et H100.

Ce n'est pas aussi prêt à l'emploi que RunPod. Vous vous connectez généralement via SSH et configurez votre propre environnement, bien que Docker soit inclus dans les modèles de VM, et que Jupyter puisse être configuré via les ports disponibles. Cela vous donne plus de contrôle, mais il faut être à l'aise avec l'installation et la gestion de vos outils.
Idéal pour : des machines virtuelles GPU abordables, de l'entraînement PyTorch sur mesure et des déploiements vLLM ou TGI autogérés.
Clouds IA en self-service
Ces plateformes ressemblent moins à des places de marché ouvertes qu'à la location d'une véritable machine cloud. Vous choisissez le GPU, lancez une VM, vous connectez via SSH ou VS Code, puis créez votre environnement pour l'entraînement, l'affinage ou le serving de modèles.
5. Hyperstack
Hyperstack vous offre une infrastructure GPU prévisible sans vous enfermer dans AWS, Azure ou un contrat entreprise complexe.
Vous sélectionnez la configuration GPU, la région, l'image du système d'exploitation et la clé SSH, puis vous lancez une machine virtuelle complète en quelques minutes. L'offre couvre capacité à la demande, spot et réservée, dans plusieurs régions de data centers.

C'est une bonne option si vous souhaitez une machine fiable pour un entraînement long ou un déploiement d'inférence autogéré. Vous devez encore configurer votre environnement, mais l'expérience est bien plus simple que de tout construire chez un hyperscaler traditionnel.
Idéal pour : des VM GPU prévisibles, des entraînements longue durée, des environnements sur mesure et du serving de modèles autogéré.
6. Hyperbolic
J'ai dépensé des centaines de dollars sur Hyperbolic, et j'aime toujours l'utiliser. Pour moi, cela a souvent été l'un des moyens les plus rapides et les moins chers d'accéder à des GPU haut de gamme. Les machines sont fiables, se lancent rapidement, et je peux me connecter directement via VS Code, ce qui donne l'impression de travailler presque en local.

Hyperbolic propose des instances GPU à la demande, des clusters réservés, une infrastructure cloud privée et une API d'inférence compatible OpenAI. Vous pouvez donc l'utiliser pour un rapide test d'affinage puis passer à de la capacité dédiée ou à de l'inférence managée sans changer de plateforme.
Ma principale difficulté est la disponibilité. Il était auparavant bien plus facile de trouver des machines H100 ou A100 abordables. Récemment, ces options économiques étaient souvent indisponibles quand j'en avais besoin. Je peux parfois trouver un H200 individuel, mais beaucoup de configurations disponibles sont des clusters 4× ou 8× GPU, bien trop coûteux et puissants pour ma charge de travail habituelle.
Idéal pour : du calcul GPU haut de gamme abordable, l'affinage de LLM, les utilisateurs VS Code, l'inférence managée et les équipes susceptibles de nécessiter ensuite des clusters réservés.
Clouds IA à l'échelle entreprise
Ces fournisseurs visent des charges IA exigeantes. On parle de clusters GPU dédiés, de réseaux haut débit, de stockage scalable, de capacité réservée et d'une infrastructure capable de tourner de manière fiable pendant des mois, pas seulement quelques heures.
7. Nebius
J'adore Nebius. J'ai surtout utilisé son Token Factory pour l'inférence : c'est rapide, fiable et extrêmement simple via son API compatible OpenAI. Vous accédez à plus de 60 modèles ouverts sans gérer l'infrastructure sous-jacente.

Je viens seulement d'explorer le versant cloud GPU, et c'est tout aussi impressionnant. Vous pouvez lancer des machines GPU individuelles ou construire des clusters longue durée avec Kubernetes managé, stockage et réseau haut débit. Nebius propose également des remises pour la réservation de grands clusters sur plusieurs mois.
Ce n'est pas qu'une plateforme pour de petites expérimentations. De grandes entreprises l'utilisent déjà pour des charges critiques. Par exemple, Revolut exécute entraînement et inférence sur plus de 200 GPU NVIDIA H100 chez Nebius, tandis que Recraft a entraîné son modèle de 20 milliards de paramètres sur la plateforme.
Idéal pour : l'inférence fiable, les clusters GPU longue durée, l'entraînement distribué, Kubernetes managé et les charges IA en production.
8. Together AI
Together AI est bien plus qu'une API d'inférence. La plateforme propose inférence managée, affinage, endpoints dédiés et clusters GPU en libre-service. Vous pouvez entraîner, personnaliser et déployer des modèles open weights sans changer de fournisseur.

Ses clusters GPU incluent du matériel haut de gamme comme les H100, H200, B200 et GB200, avec réseau InfiniBand, stockage persistant et prise en charge de Kubernetes et de Slurm. Les clusters peuvent être lancés à la demande ou réservés pour des charges plus longues.
C'est sans doute trop pour quelqu'un qui a seulement besoin d'un GPU économique pour une expérience rapide. En revanche, cela a beaucoup de sens pour les entreprises qui veulent une infrastructure fiable pour entraîner, affiner et servir des modèles à grande échelle.
Idéal pour : des clusters GPU d'entreprise, l'entraînement de modèles à grande échelle, l'affinage managé, l'inférence dédiée et les entreprises qui bâtissent des systèmes d'IA en production.
Plateformes conçues pour les développeurs et adaptées aux notebooks
Ces plateformes s'adressent aux développeurs qui veulent se concentrer sur le code plutôt que de passer des heures à gérer l'infrastructure cloud. Elles offrent des outils familiers comme des notebooks et VS Code, tout en gérant une grande partie de l'approvisionnement GPU en arrière-plan.
9. Modal
Modal est totalement différent de la location d'une machine GPU classique. Vous écrivez du code Python, vous choisissez le GPU nécessaire, et Modal l'exécute dans un conteneur serverless. La plateforme peut évoluer automatiquement de zéro à plusieurs GPU, et vous êtes facturé en fonction du temps réel d'utilisation des ressources.

C'est idéal pour déployer des API d'inférence, exécuter des pipelines d'évaluation, affiner des modèles et gérer des charges qui nécessitent soudainement plus de GPU. Modal propose aussi des notebooks GPU qui se lancent en quelques secondes, prennent en charge des environnements personnalisés et peuvent utiliser jusqu'à huit GPU A100 ou H100.
La seule chose à intégrer est que Modal requiert un changement de paradigme. Vous n'ouvrez pas simplement une VM pour l'utiliser comme un ordinateur distant. Vous définissez votre infrastructure en Python, ce qui peut sembler inhabituel au début, mais devient extrêmement puissant une fois maîtrisé.
Idéal pour : l'inférence serverless, l'évaluation de modèles, les pipelines automatisés, l'affinage et les charges qui doivent monter et descendre automatiquement en charge.
10. Thunder Compute
Thunder Compute correspond presque exactement à ce que beaucoup de data scientists attendent d'un cloud GPU. Vous lancez une machine et vous vous y connectez directement via VS Code, Cursor, Windsurf, la ligne de commande ou Jupyter Notebook. JupyterLab est déjà installé, ce qui permet de commencer à expérimenter sans passer des heures à configurer l'environnement.

J'apprécie particulièrement l'idée de son extension VS Code. Plutôt que de basculer sans cesse entre un tableau de bord cloud, un terminal SSH et un éditeur local, vous créez et ouvrez l'instance GPU comme espace de travail distant directement dans votre éditeur. La sensation se rapproche de celle du local, à ceci près que vous disposez désormais d'un GPU cloud puissant.
Thunder Compute propose des modes distincts de prototypage et de production. Vous pouvez démarrer avec une machine simple pour expérimenter puis passer à des configurations de production avec stockage persistant et prise en charge de plusieurs GPU.
Idéal pour : la recherche basée sur Jupyter, les utilisateurs VS Code, l'expérimentation de modèles, les travaux interactifs de data science et toute personne cherchant une alternative plus puissante à Google Colab.
Comment choisir le bon fournisseur de GPU
Il n'existe pas de meilleur fournisseur de GPU universel. Le bon choix dépend de la disponibilité des GPU, du prix, de la facilité d'utilisation, des coûts de stockage et de votre besoin d'un notebook, d'une VM, d'inférence serverless ou d'un cluster GPU complet :
- Choisissez Vast.ai, RunPod, Spheron ou TensorDock si vous voulez une capacité flexible, un large choix de GPU et des prix compétitifs.
- Choisissez Hyperbolic ou Hyperstack si vous voulez une VM cloud plus fiable pour l'entraînement, les notebooks ou l'inférence auto-hébergée.
- Choisissez Nebius ou Together AI si vous avez besoin de clusters dédiés, d'entraînement distribué, de capacité réservée ou d'une infrastructure à l'échelle de la production.
- Choisissez Modal ou Thunder Compute lorsque la simplicité d'usage prime. Modal est idéal pour les charges serverless, tandis que Thunder Compute convient mieux aux workflows familiers avec VS Code et Jupyter.
Conclusion
J'utilise surtout Vast.ai, RunPod, Hyperbolic et Modal, car ils sont simples, flexibles et relativement abordables. Vast.ai est généralement mon premier choix pour dénicher la machine la moins chère. RunPod est la plateforme la plus facile à utiliser, Hyperbolic est rapide et fiable quand des GPU sont disponibles, et Modal est excellent pour l'inférence serverless et les charges automatisées.
Pour de toutes petites expériences, j'utilise encore Google Colab ou un Jupyter Notebook local. Cependant, Colab est limité, souvent lent, et ce n'est pas ce que je recommanderais pour un affinage sérieux de LLM, du serving de modèles ou des entraînements longue durée.
La meilleure plateforme est, au final, celle qui vous permet de démarrer vite sans vous transformer en ingénieur d'infrastructure cloud. Et si vous souhaitez tout de même le devenir (ou comprendre ce qui se passe sous le capot), nous vous recommandons de commencer par notre cours Understanding Cloud Computing.
FAQ sur les meilleurs fournisseurs de GPU cloud
Quel est le fournisseur de GPU le moins cher pour l'affinage et l'inférence de LLM ?
Les places de marché comme Vast.ai et TensorDock affichent souvent les tarifs horaires les plus bas car elles mutualisent la capacité de nombreux hôtes, tandis que Spheron et Hyperbolic restent compétitifs sur les cartes haut de gamme comme la H100. Votre coût total dépend du GPU, du stockage et de la durée d'exécution, donc le tarif horaire le plus bas n'est pas toujours la facture la plus faible. Pour des tests courts, le pricing spot et la facturation à la minute peuvent limiter la dépense à quelques centimes ou dollars.
Ai-je besoin d'un GPU H100 pour affiner un grand modèle de langage ?
Non. Les modèles petits à moyens s'affinent très bien sur une carte grand public comme la RTX 4090 (24 Go) en utilisant LoRA ou QLoRA avec une quantification en 4 bits, ce qui réduit fortement l'usage mémoire. Vous avez surtout besoin d'une A100 ou H100 quand le modèle est trop volumineux pour tenir dans la mémoire d'une carte plus petite, ou si vous voulez accélérer l'entraînement sur un gros jeu de données.
Quelle est la différence entre une place de marché GPU et une plateforme GPU serverless ?
Une place de marché comme Vast.ai ou TensorDock vous loue une machine complète que vous configurez et payez pendant tout le temps où elle tourne, qu'elle soit active ou idle. Une plateforme serverless comme Modal exécute votre code dans des conteneurs qui partent de zéro et facture uniquement les secondes d'usage GPU effectif. Les places de marché offrent plus de contrôle et des tarifs horaires plus bas, tandis que le serverless élimine le coût d'inactivité et l'essentiel de la configuration.
Puis-je utiliser Jupyter Notebook ou VS Code avec ces fournisseurs de GPU ?
Oui. La plupart des fournisseurs listés ici prennent en charge Jupyter Notebook, un terminal dans le navigateur, SSH ou une connexion distante VS Code, et des plateformes comme RunPod et Thunder Compute vous y amènent en quasi un clic. Là où Jupyter n'est pas préinstallé, vous pouvez généralement l'installer et l'ouvrir en quelques minutes.
Ces fournisseurs de GPU cloud sont-ils moins chers qu'AWS, Azure ou Google Cloud ?
En général oui, souvent de manière significative, car ils se concentrent sur la location de GPU sans la surcharge d'une plateforme hyperscaler complète. Des fournisseurs comme Spheron et Hyperbolic affichent des tarifs H100 par GPU bien inférieurs à ceux des clouds majeurs. La contrepartie : moins de services managés et, sur certaines places de marché, une disponibilité et une fiabilité moins prévisibles.
En tant que data scientist certifié, je suis passionné par l'utilisation des technologies de pointe pour créer des applications innovantes d'apprentissage automatique. Avec une solide expérience en reconnaissance vocale, en analyse de données et en reporting, en MLOps, en IA conversationnelle et en NLP, j'ai affiné mes compétences dans le développement de systèmes intelligents qui peuvent avoir un impact réel. En plus de mon expertise technique, je suis également un communicateur compétent, doué pour distiller des concepts complexes dans un langage clair et concis. En conséquence, je suis devenu un blogueur recherché dans le domaine de la science des données, partageant mes idées et mes expériences avec une communauté grandissante de professionnels des données. Actuellement, je me concentre sur la création et l'édition de contenu, en travaillant avec de grands modèles linguistiques pour développer un contenu puissant et attrayant qui peut aider les entreprises et les particuliers à tirer le meilleur parti de leurs données.


