Audaks Cloud
INFRAESTRUTURA
9 min

VPS com GPU no Brasil: O Que Existe, Quanto Custa e Quando Faz Sentido (2026)

VPS com GPU pode ser uma fatia de placa (vGPU/MIG), uma GPU inteira em passthrough ou um bare metal com GPU. Quais placas aparecem em cada faixa (L4, L40S, A100, H100), quanto custa por hora e por mês em 2026, e quando a VM com GPU não serve.

#vps com gpu#gpu vps#servidor com gpu#servidor gpu#placa de video para servidor#vps gpu#alugar gpu
infraestrutura
23 Set 2026·9 min de leitura

Resposta rápida

VPS com GPU é uma máquina virtual que enxerga uma GPU NVIDIA, de três formas: fatia de placa (vGPU ou MIG, mais barata, recursos compartilhados), GPU inteira em passthrough (desempenho de bare metal com a flexibilidade de VM) ou servidor dedicado com GPU (hardware só seu, várias placas). No Brasil, as placas típicas por faixa são L4 e T4 na entrada, L40S no meio e A100/H100 no topo. Referência de custo internacional em 2026: de US$ 0,40/h (L4) a US$ 3,50/h (H100); contrato mensal em Real com NF evita a variação do dólar e o IOF. A VM com GPU serve pra inferência de LLM interno, difusão, vídeo, VDI e ML de porte médio; pra treinar modelo grande em várias GPUs com NVLink, o caminho é bare metal.

"VPS com GPU" é um termo que esconde três produtos diferentes, e a diferença entre eles é exatamente o que decide se o seu projeto vai rodar bem ou se você vai pagar por uma placa que outro cliente está usando. Vamos separar as coisas.

Os três tipos de "VPS com GPU"

TipoComo funcionaPra quemCuidado
Fatia de GPU (vGPU / MIG)A placa física é dividida entre várias VMs; cada uma recebe uma parte fixa (MIG) ou compartilhada no tempo (vGPU)Inferência leve, VDI, testes, muitos usuários pequenosSem MIG, o desempenho varia com os vizinhos; confirme se a fatia é dedicada
GPU inteira em passthroughA VM recebe a placa completa via PCIe; o hypervisor não toca nelaInferência de LLM em produção, difusão, fine-tuning, ML de PME1 VM por placa; multi-GPU depende de PCIe (sem NVLink)
Servidor dedicado com GPU (bare metal)Máquina física inteira, 1 a 8 GPUs, sem hypervisorTreino, HPC, cargas 24/7, isolamento total, várias GPUs com NVLinkContrato mensal e projeto; não é self-service

A pergunta que você faz ao provedor antes de qualquer outra: "a GPU é dedicada à minha VM ou compartilhada?". É a mesma lógica do overcommit de CPU em VPS barata, só que com uma placa de milhares de dólares no meio.

Quais placas aparecem em cada faixa

  • Entrada: NVIDIA L4 (24 GB, 72 W) e a T4 mais antiga. Transcodificação, visão computacional, LLMs pequenos, VDI de escritório. Detalhes em L40S vs L40 vs L4.
  • Meio: L40S (48 GB, FP8). O canivete: LLM até ~30B quantizado, Stable Diffusion, LoRA, render.
  • Topo: A100 (40/80 GB) e H100 (80 GB). Modelos maiores, treino, HPC. Veja A100 e H100.

Quanto custa em 2026

Placa (GPU inteira)Aluguel por hora (referência cloud global)Mensal aproximado (730 h)Observação
L4 24 GBUS$ 0,40 a US$ 0,70US$ 300 a US$ 500Melhor custo pra vídeo e inferência leve
L40S 48 GBUS$ 0,80 a US$ 1,20US$ 600 a US$ 900Melhor custo pra LLM médio e difusão
A100 80 GBUS$ 1,00 a US$ 1,80US$ 750 a US$ 1.300Treino FP16, HPC
H100 80 GBUS$ 2,00 a US$ 3,50US$ 1.500 a US$ 2.500Treino e inferência pesada

Some ao valor da GPU a VM em volta dela: vCPU, RAM (regra prática: pelo menos 2x a memória da GPU), disco NVMe pra dataset e modelo (um 70B quantizado ocupa dezenas de GB; os checkpoints de treino, centenas) e banda pra baixar pesos. Em Real com NF, o contrato mensal tira o câmbio e o IOF da conta e simplifica a vida do financeiro, um ponto que costuma pesar mais que os centavos por hora.

Quando a VM com GPU serve, e quando não

Serve pra: LLM interno (RAG sobre documentos da empresa, assistente pra atendimento), geração de imagem pra marketing e e-commerce, transcrição e análise de vídeo, VDI com CAD/BIM, treinamento de modelos de porte médio, ambientes de desenvolvimento de IA.

Não serve pra: treinar modelo grande em 4 ou 8 GPUs (precisa de NVLink, ou seja, bare metal HGX), cargas que exigem FP64 de HPC em escala, e qualquer caso em que você não consiga garantir que a GPU é sua. Aí a conversa é GPU em servidor dedicado.

Checklist antes de contratar

  1. GPU dedicada (passthrough ou MIG) ou compartilhada por tempo?
  2. Driver NVIDIA e CUDA compatíveis com o seu framework (PyTorch, TensorFlow, vLLM, TensorRT-LLM) já instalados ou por sua conta?
  3. RAM da VM de pelo menos 2x a memória da GPU; disco NVMe com espaço pra modelo, dataset e checkpoints.
  4. Banda e limite de tráfego: baixar pesos de 100 GB+ não pode virar cobrança surpresa.
  5. Snapshot e backup: GPU não protege dado; veja por que snapshot não é backup.
  6. Preço em Real com NF, ou em dólar com IOF?
  7. Suporte que entende de GPU (driver, versão de CUDA, placa que "some" da VM) em horário que você precisa.

Perguntas frequentes

VPS com GPU é o mesmo que GPU cloud?

Na prática sim: GPU cloud costuma ser uma VM com GPU (fatiada ou inteira) cobrada por hora ou por mês. O que muda entre provedores é se a placa é dedicada e como se paga.

Dá pra ter Windows numa VPS com GPU?

Dá, e é comum em VDI e CAD. A licença de Windows Server é contratada à parte, nunca embutida no preço da GPU.

Qual a menor GPU que roda um LLM de 7B?

Uma L4 de 24 GB roda um 7B em FP16 com folga e um 13B quantizado. Pra vários usuários simultâneos, suba pra L40S.

Consigo várias GPUs numa mesma VM?

Em passthrough, sim, limitado pelo servidor físico e sem NVLink. Pra 4 ou 8 GPUs conversando a 900 GB/s, é servidor dedicado HGX.

Quer uma GPU dedicada de verdade, em Real e com NF?

Conta o que vai rodar (modelo, usuários, vídeo, render) e a Audaks dimensiona a placa e a máquina em volta, VM ou servidor dedicado, em datacenter Tier III em São Paulo com suporte 24/7 em português. A resposta vem com configuração e disponibilidade, não com a placa mais cara.

Falar com um especialista em GPU →

Preferindo hardware inteiro só seu? Veja também servidor dedicado com GPU sob medida.

Pronto para migrar para a nuvem?

Nossa equipe esta pronta para ajudar voce nessa jornada. Agende uma consultoria gratuita.