Resposta rápida
VPS com GPU é uma máquina virtual que enxerga uma GPU NVIDIA, de três formas: fatia de placa (vGPU ou MIG, mais barata, recursos compartilhados), GPU inteira em passthrough (desempenho de bare metal com a flexibilidade de VM) ou servidor dedicado com GPU (hardware só seu, várias placas). No Brasil, as placas típicas por faixa são L4 e T4 na entrada, L40S no meio e A100/H100 no topo. Referência de custo internacional em 2026: de US$ 0,40/h (L4) a US$ 3,50/h (H100); contrato mensal em Real com NF evita a variação do dólar e o IOF. A VM com GPU serve pra inferência de LLM interno, difusão, vídeo, VDI e ML de porte médio; pra treinar modelo grande em várias GPUs com NVLink, o caminho é bare metal.
"VPS com GPU" é um termo que esconde três produtos diferentes, e a diferença entre eles é exatamente o que decide se o seu projeto vai rodar bem ou se você vai pagar por uma placa que outro cliente está usando. Vamos separar as coisas.
Os três tipos de "VPS com GPU"
| Tipo | Como funciona | Pra quem | Cuidado |
|---|---|---|---|
| Fatia de GPU (vGPU / MIG) | A placa física é dividida entre várias VMs; cada uma recebe uma parte fixa (MIG) ou compartilhada no tempo (vGPU) | Inferência leve, VDI, testes, muitos usuários pequenos | Sem MIG, o desempenho varia com os vizinhos; confirme se a fatia é dedicada |
| GPU inteira em passthrough | A VM recebe a placa completa via PCIe; o hypervisor não toca nela | Inferência de LLM em produção, difusão, fine-tuning, ML de PME | 1 VM por placa; multi-GPU depende de PCIe (sem NVLink) |
| Servidor dedicado com GPU (bare metal) | Máquina física inteira, 1 a 8 GPUs, sem hypervisor | Treino, HPC, cargas 24/7, isolamento total, várias GPUs com NVLink | Contrato mensal e projeto; não é self-service |
A pergunta que você faz ao provedor antes de qualquer outra: "a GPU é dedicada à minha VM ou compartilhada?". É a mesma lógica do overcommit de CPU em VPS barata, só que com uma placa de milhares de dólares no meio.
Quais placas aparecem em cada faixa
- Entrada: NVIDIA L4 (24 GB, 72 W) e a T4 mais antiga. Transcodificação, visão computacional, LLMs pequenos, VDI de escritório. Detalhes em L40S vs L40 vs L4.
- Meio: L40S (48 GB, FP8). O canivete: LLM até ~30B quantizado, Stable Diffusion, LoRA, render.
- Topo: A100 (40/80 GB) e H100 (80 GB). Modelos maiores, treino, HPC. Veja A100 e H100.
Quanto custa em 2026
| Placa (GPU inteira) | Aluguel por hora (referência cloud global) | Mensal aproximado (730 h) | Observação |
|---|---|---|---|
| L4 24 GB | US$ 0,40 a US$ 0,70 | US$ 300 a US$ 500 | Melhor custo pra vídeo e inferência leve |
| L40S 48 GB | US$ 0,80 a US$ 1,20 | US$ 600 a US$ 900 | Melhor custo pra LLM médio e difusão |
| A100 80 GB | US$ 1,00 a US$ 1,80 | US$ 750 a US$ 1.300 | Treino FP16, HPC |
| H100 80 GB | US$ 2,00 a US$ 3,50 | US$ 1.500 a US$ 2.500 | Treino e inferência pesada |
Some ao valor da GPU a VM em volta dela: vCPU, RAM (regra prática: pelo menos 2x a memória da GPU), disco NVMe pra dataset e modelo (um 70B quantizado ocupa dezenas de GB; os checkpoints de treino, centenas) e banda pra baixar pesos. Em Real com NF, o contrato mensal tira o câmbio e o IOF da conta e simplifica a vida do financeiro, um ponto que costuma pesar mais que os centavos por hora.
Quando a VM com GPU serve, e quando não
Serve pra: LLM interno (RAG sobre documentos da empresa, assistente pra atendimento), geração de imagem pra marketing e e-commerce, transcrição e análise de vídeo, VDI com CAD/BIM, treinamento de modelos de porte médio, ambientes de desenvolvimento de IA.
Não serve pra: treinar modelo grande em 4 ou 8 GPUs (precisa de NVLink, ou seja, bare metal HGX), cargas que exigem FP64 de HPC em escala, e qualquer caso em que você não consiga garantir que a GPU é sua. Aí a conversa é GPU em servidor dedicado.
Checklist antes de contratar
- GPU dedicada (passthrough ou MIG) ou compartilhada por tempo?
- Driver NVIDIA e CUDA compatíveis com o seu framework (PyTorch, TensorFlow, vLLM, TensorRT-LLM) já instalados ou por sua conta?
- RAM da VM de pelo menos 2x a memória da GPU; disco NVMe com espaço pra modelo, dataset e checkpoints.
- Banda e limite de tráfego: baixar pesos de 100 GB+ não pode virar cobrança surpresa.
- Snapshot e backup: GPU não protege dado; veja por que snapshot não é backup.
- Preço em Real com NF, ou em dólar com IOF?
- Suporte que entende de GPU (driver, versão de CUDA, placa que "some" da VM) em horário que você precisa.
Perguntas frequentes
VPS com GPU é o mesmo que GPU cloud?
Na prática sim: GPU cloud costuma ser uma VM com GPU (fatiada ou inteira) cobrada por hora ou por mês. O que muda entre provedores é se a placa é dedicada e como se paga.
Dá pra ter Windows numa VPS com GPU?
Dá, e é comum em VDI e CAD. A licença de Windows Server é contratada à parte, nunca embutida no preço da GPU.
Qual a menor GPU que roda um LLM de 7B?
Uma L4 de 24 GB roda um 7B em FP16 com folga e um 13B quantizado. Pra vários usuários simultâneos, suba pra L40S.
Consigo várias GPUs numa mesma VM?
Em passthrough, sim, limitado pelo servidor físico e sem NVLink. Pra 4 ou 8 GPUs conversando a 900 GB/s, é servidor dedicado HGX.
Quer uma GPU dedicada de verdade, em Real e com NF?
Conta o que vai rodar (modelo, usuários, vídeo, render) e a Audaks dimensiona a placa e a máquina em volta, VM ou servidor dedicado, em datacenter Tier III em São Paulo com suporte 24/7 em português. A resposta vem com configuração e disponibilidade, não com a placa mais cara.
Falar com um especialista em GPU →Preferindo hardware inteiro só seu? Veja também servidor dedicado com GPU sob medida.
Leitura relacionada
