Programa
Cientistas de dados, engenheiros de ML e engenheiros de LLM têm perfis bem diferentes, mas quase todo mundo quer a mesma coisa da infraestrutura: o mínimo possível. Ninguém quer perder horas configurando ambientes em nuvem ou navegando por serviços complexos da AWS. A gente quer clicar em alguns botões, abrir um terminal ou Jupyter Notebook, escolher um template e começar a treinar, fazer fine-tuning ou servir um modelo.
Os provedores deste guia foram escolhidos com isso em mente. Eles oferecem painéis fáceis de usar, ambientes pré-configurados, notebooks, terminais, templates de contêiner e guias de configuração claros; quando o Jupyter não vem por padrão, a maioria permite instalá-lo em poucos minutos.
Ainda assim, não são todos para o mesmo público. Alguns são marketplaces focados em preço e variedade de hardware; outros oferecem VMs previsíveis, execução serverless em GPU, inferência gerenciada ou clusters em escala enterprise para treinamento distribuído. Comparamos dez deles em quatro categorias: marketplaces de GPU e redes de capacidade flexível, nuvens de GPU de autoatendimento, nuvens de IA em escala enterprise e plataformas developer-first, amigáveis a notebooks.
Marketplaces de GPU e redes de capacidade flexível
Marketplaces de GPU foram projetados para oferecer acesso flexível a capacidade distribuída de GPU. São úteis para experimentos, jobs em lote, fine-tuning curto e sempre que a escolha do hardware e o custo pesarem mais.
1. Vast.ai
Vast.ai é a plataforma que eu mais uso para encontrar GPU acessível para servir modelos e fazer fine-tuning de LLMs.
Seu marketplace oferece uma grande seleção de máquinas com GPU que você pode comparar por hardware, VRAM, confiabilidade, localização e preço. Cada anúncio detalha claramente os custos de computação e armazenamento, então você sabe exatamente pelo que está pagando.

As instâncias suportam Jupyter Notebook, terminais no navegador, SSH e conexões com o VS Code. Para testes rápidos, muitas vezes gasto apenas alguns centavos antes de desligar a instância. No entanto, a disponibilidade e a confiabilidade podem variar, pois o hardware vem de diferentes hosts do marketplace.
Ideal para: experimentação acessível, servir modelos, fine-tuning com LoRA e inferência em lote.
2. RunPod
RunPod é a minha plataforma de GPU favorita, e já gastei centenas de dólares usando-a para fine-tuning e inferência de LLMs.
É mais rápida e fácil de usar do que a Vast.ai, embora boas máquinas possam sair caras quando se considera os custos de computação e armazenamento. O RunPod funciona quase perfeitamente logo de cara, com templates prontos, JupyterLab, terminal web, SSH e integração com VS Code.

Meu único problema recente tem sido a disponibilidade de GPU. Máquinas populares às vezes não estão disponíveis, me obrigando a esperar ou escolher uma opção mais cara. Apesar disso, o RunPod continua sendo uma das melhores plataformas para cientistas de dados que querem treinar ou servir modelos sem precisar aprender uma infraestrutura de nuvem complexa.
Usei o RunPod em dois dos nossos tutoriais recentes, fine-tuning do DiffusionGemma para QA biomédico e fine-tuning do Gemma 4, ambos rodam do início ao fim em um único pod de GPU do RunPod.
Ideal para: iniciantes, cientistas de dados, fine-tuning de LLMs, servir modelos e quem quer um ambiente de GPU que simplesmente funcione.
3. Spheron Network
Spheron é uma boa opção para acessar GPUs de ponta com preço acessível, sem lidar com AWS ou contratos de longo prazo.
Ela reúne capacidade de GPU de vários provedores de data center em um único painel, com máquinas em VM e bare metal, acesso root por SSH, preços transparentes e cobrança por minuto.

Oferece desde máquinas com RTX 4090 e A100 até GPUs H100, H200 e B200. Para workloads maiores, você também pode implantar clusters multi-GPU e multi-nó com redes NVLink, InfiniBand ou RoCE. É um pouco mais focada em infraestrutura do que o RunPod, mas dá muito mais flexibilidade para times de LLM que precisam de treinamento distribuído.
Ideal para: GPUs de ponta acessíveis, treinamento de LLMs em multi-GPU, workloads distribuídos e times que precisam de acesso via VM ou bare metal.
4. TensorDock
TensorDock é um marketplace de GPU acessível para lançar máquinas virtuais completas.
Você escolhe GPU, CPU, RAM, armazenamento, localização e sistema operacional, e recebe uma máquina com acesso root. Há uma enorme variedade de hardware, de GPUs de consumidor mais baratas até potentes máquinas A100 e H100.

Não é tão pronto para uso quanto o RunPod. Normalmente você se conecta via SSH e configura seu próprio ambiente, embora o Docker venha incluído nos templates de VM, e o Jupyter possa ser configurado pelas portas disponíveis. Isso dá mais controle, mas você precisa estar à vontade para instalar e gerenciar suas próprias ferramentas.
Ideal para: máquinas virtuais de GPU acessíveis, treinamento customizado em PyTorch e deploys autogerenciados de vLLM ou TGI.
Nuvens de GPU de autoatendimento
Essas plataformas se parecem menos com marketplaces abertos e mais com alugar uma máquina de nuvem completa. Você escolhe a GPU, lança uma VM, conecta via SSH ou VS Code e cria seu próprio ambiente para treinamento, fine-tuning ou servir modelos.
5. Hyperstack
Hyperstack oferece infraestrutura de GPU previsível sem prender você à AWS, Azure ou a um contrato enterprise complicado.
Você seleciona a configuração da GPU, a região, a imagem do sistema operacional e a chave SSH, e então lança uma máquina virtual completa em minutos. Há capacidade sob demanda, spot e reservada em várias regiões de data center.

É uma boa opção quando você precisa de uma máquina confiável para um treino mais longo ou um deploy de inferência autogerenciado. Você ainda precisa configurar seu ambiente, mas a experiência é muito mais direta do que montar tudo em um hyperscaler tradicional.
Ideal para: VMs de GPU previsíveis, jobs de treinamento de longa duração, ambientes customizados e servir modelos de forma autogerenciada.
6. Hyperbolic
Já gastei centenas de dólares na Hyperbolic, e continua sendo uma das minhas favoritas. Para mim, muitas vezes tem sido uma das formas mais rápidas e baratas de acessar GPUs de ponta. As máquinas são confiáveis, iniciam rápido e posso conectar direto pelo VS Code, o que faz tudo parecer quase local.

A Hyperbolic oferece instâncias de GPU sob demanda, clusters reservados, infraestrutura de nuvem privada e uma API de inferência compatível com OpenAI. Isso significa que você pode usá-la para um experimento rápido de fine-tuning e depois migrar para capacidade dedicada ou inferência gerenciada sem trocar de plataforma.
Meu maior problema é a disponibilidade. Antes era bem mais fácil encontrar máquinas H100 ou A100 individuais com preço acessível. Recentemente, essas opções mais baratas costumam não estar disponíveis quando eu preciso. Posso até achar uma H200 isolada, mas muitas configurações disponíveis são clusters de 4x ou 8x GPUs, caros e poderosos demais para meu dia a dia.
Ideal para: computação de GPU de ponta acessível, fine-tuning de LLMs, usuários de VS Code, inferência gerenciada e times que talvez precisem de clusters reservados depois.
Nuvens de IA em escala enterprise
Esses provedores são para workloads de IA sérios. Estamos falando de clusters de GPU dedicados, redes de alta velocidade, armazenamento escalável, capacidade reservada e infraestrutura que roda com confiabilidade por meses, não só por algumas horas.
7. Nebius
Eu adoro a Nebius. Eu a tenho usado principalmente a Token Factory para inferência — é rápida, confiável e extremamente fácil de usar por sua API compatível com OpenAI. Você acessa mais de 60 modelos open source sem precisar gerenciar a infraestrutura por trás.

Recentemente comecei a explorar também o lado de GPU cloud e é igualmente impressionante. Você pode lançar máquinas individuais com GPU ou montar clusters de longa duração com Kubernetes gerenciado, armazenamento e rede de alta velocidade. A Nebius também oferece descontos para reservas de grandes clusters por vários meses.
Não é só para experimentos pequenos. Grandes empresas já usam para workloads sérios. Por exemplo, o Revolut executa treinamento e inferência em mais de 200 GPUs NVIDIA H100 na Nebius, enquanto a Recraft treinou seu modelo de 20 bilhões de parâmetros usando a plataforma.
Ideal para: inferência confiável, clusters de GPU de longa duração, treinamento distribuído, Kubernetes gerenciado e workloads de IA em produção.
8. Together AI
Together AI é bem mais do que uma API de inferência. Ela oferece inferência gerenciada, fine-tuning, endpoints dedicados e clusters de GPU de autoatendimento em uma única plataforma. Você treina, personaliza e faz deploy de modelos open-weight sem precisar trocar de provedor.

Seus clusters de GPU incluem hardware de ponta como H100, H200, B200 e GB200, com rede InfiniBand, armazenamento persistente e suporte a Kubernetes e Slurm. Os clusters podem ser lançados sob demanda ou reservados para workloads mais longos.
Provavelmente é demais para quem só precisa de uma GPU barata para um experimento rápido. Mas faz muito sentido para empresas que querem infraestrutura confiável para treinar, ajustar e servir modelos em escala.
Ideal para: clusters de GPU enterprise, treinamento de modelos em larga escala, fine-tuning gerenciado, inferência dedicada e empresas construindo sistemas de IA de produção.
Plataformas developer-first e amigáveis a notebooks
Essas plataformas foram feitas para desenvolvedores que preferem focar no código em vez de gastar horas gerenciando infraestrutura de nuvem. Elas oferecem ferramentas familiares como notebooks e VS Code enquanto cuidam do provisionamento de GPU nos bastidores.
9. Modal
Modal é completamente diferente de alugar uma máquina de GPU tradicional. Você escreve código em Python, escolhe a GPU de que precisa e o Modal executa em um contêiner serverless. Ele escala automaticamente de zero para várias GPUs, e a cobrança é baseada no tempo em que seu código realmente usa os recursos.

É ótimo para publicar APIs de inferência, rodar pipelines de avaliação, fazer fine-tuning de modelos e lidar com workloads que de repente demandam mais GPUs. O Modal também oferece notebooks com GPU que iniciam em segundos, suportam ambientes customizados e podem usar até oito GPUs A100 ou H100.
Só é importante entender que o Modal pede uma mudança de mindset. Você não está simplesmente abrindo uma VM e usando como um computador remoto. Você define sua infraestrutura em Python — pode parecer estranho no começo, mas se torna extremamente poderoso quando você pega o jeito.
Ideal para: inferência serverless, avaliação de modelos, pipelines automatizados, fine-tuning e workloads que precisam escalar automática e elasticamente.
10. Thunder Compute
Thunder Compute é praticamente o que muitos cientistas de dados querem de uma nuvem de GPU. Você lança uma máquina e se conecta direto pelo VS Code, Cursor, Windsurf, pela linha de comando ou pelo Jupyter Notebook. O JupyterLab já vem instalado, então dá para começar a experimentar sem gastar horas configurando o ambiente.

Gosto especialmente da ideia da extensão para VS Code. Em vez de ficar alternando entre painel da nuvem, terminal SSH e editor local, você cria e abre a instância de GPU como um workspace remoto direto no seu editor. A experiência fica muito próxima de trabalhar no seu próprio computador — com a vantagem de ter uma GPU poderosa na nuvem.
O Thunder Compute oferece modos separados de prototipagem e produção. Você pode começar com uma máquina simples para experimentos e depois migrar para configurações de produção com armazenamento persistente e suporte a múltiplas GPUs.
Ideal para: pesquisa com Jupyter, usuários de VS Code, experimentação com modelos, trabalho interativo de data science e quem busca uma alternativa mais potente ao Google Colab.
Como escolher o provedor de GPU certo
Não existe um único melhor provedor de GPU. A escolha depende da disponibilidade de GPU, preço, facilidade de uso, custos de armazenamento e se você precisa de um notebook, uma VM, inferência serverless ou um cluster completo de GPU:
- Escolha Vast.ai, RunPod, Spheron ou TensorDock quando você quer capacidade flexível, ampla variedade de GPUs e preços competitivos.
- Escolha Hyperbolic ou Hyperstack quando você precisa de uma VM de nuvem mais confiável para treinamento, notebooks ou inferência self-hosted.
- Escolha Nebius ou Together AI quando você precisa de clusters dedicados, treinamento distribuído, capacidade reservada ou infraestrutura em escala de produção.
- Escolha Modal ou Thunder Compute quando a facilidade de uso for o mais importante. O Modal é ideal para workloads serverless, enquanto o Thunder Compute é melhor para fluxos de trabalho familiares com VS Code e Jupyter.
Considerações finais
Eu uso principalmente Vast.ai, RunPod, Hyperbolic e Modal porque são fáceis de usar, flexíveis e relativamente acessíveis. A Vast.ai costuma ser minha primeira escolha para achar a máquina mais barata. O RunPod é a plataforma mais simples de usar, a Hyperbolic é rápida e confiável quando há GPUs disponíveis, e o Modal é excelente para inferência serverless e workloads automatizados.
Para experimentos bem pequenos, ainda uso Google Colab ou um Jupyter Notebook local. Porém, o Colab é limitado, muitas vezes lento e não é algo que eu recomendaria para fine-tuning sério de LLM, servir modelos ou jobs de treinamento longos.
No fim, a melhor plataforma é aquela que deixa você começar a trabalhar rápido, sem te obrigar a virar um engenheiro de infraestrutura de nuvem. Caso você queira se tornar um de qualquer forma (ou entender o que acontece por trás dos panos), recomendo começar pelo nosso curso Understanding Cloud Computing.
Melhores provedores de GPU na nuvem: FAQs
Qual é o provedor de GPU mais barato para fine-tuning e inferência de LLMs?
Marketplaces como Vast.ai e TensorDock tendem a ter as menores taxas por hora porque reúnem capacidade de muitos hosts, enquanto Spheron e Hyperbolic são competitivos em placas de ponta como a H100. Seu custo total depende da GPU, do armazenamento e do tempo de execução do job, então a menor taxa por hora nem sempre é a menor fatura. Para testes curtos, preços spot e cobrança por minuto podem reduzir a execução a poucos centavos ou dólares.
Eu preciso de uma GPU H100 para fazer fine-tuning de um LLM?
Não. Modelos pequenos e médios têm ótimo desempenho de fine-tuning em uma placa de consumidor como a RTX 4090 (24 GB) usando LoRA ou QLoRA com quantização a 4 bits, o que reduz bastante o uso de memória. Você principalmente precisa de uma A100 ou H100 quando o modelo é grande demais para caber na memória de uma placa menor ou quando quer treinar mais rápido em um dataset grande.
Qual é a diferença entre um marketplace de GPU e uma plataforma de GPU serverless?
Um marketplace como Vast.ai ou TensorDock aluga uma máquina completa para você configurar e pela qual você paga o tempo todo em que estiver rodando — ativa ou ociosa. Uma plataforma serverless como o Modal executa seu código em contêineres que escalam a partir de zero e cobra apenas pelos segundos em que seu job usa a GPU. Marketplaces dão mais controle e tarifas por hora mais baixas, enquanto o serverless elimina custo ocioso e a maior parte da configuração.
Posso usar Jupyter Notebook ou VS Code com esses provedores de GPU?
Sim. A maioria dos provedores aqui suporta Jupyter Notebook, terminal no navegador, SSH ou conexão remota com VS Code, e plataformas como RunPod e Thunder Compute chegam lá com praticamente um clique. Onde o Jupyter não vem pré-instalado, geralmente dá para instalar e abrir em poucos minutos.
Esses provedores de GPU na nuvem são mais baratos que AWS, Azure ou Google Cloud?
Normalmente sim, e muitas vezes por uma boa margem, porque eles se concentram no aluguel de GPU sem a sobrecarga de uma plataforma hyperscaler completa. Provedores como Spheron e Hyperbolic listam preços de H100 bem abaixo do preço por GPU nas nuvens principais. A troca é ter menos serviços gerenciados e, em alguns marketplaces, disponibilidade e confiabilidade menos previsíveis.
Sou um cientista de dados certificado que gosta de criar aplicativos de aprendizado de máquina e escrever blogs sobre ciência de dados. No momento, estou me concentrando na criação e edição de conteúdo e no trabalho com modelos de linguagem de grande porte.
