Resposta rápida
A NVIDIA H100 (arquitetura Hopper, 80 GB de memória HBM) é a GPU de datacenter que virou padrão pra treinar e servir modelos grandes de IA. Em 2026 uma unidade nova custa na faixa de US$ 25 mil a US$ 35 mil no mercado internacional (no Brasil, importada, o valor costuma subir 60% a 100% com impostos), e o aluguel em nuvem gira entre US$ 2 e US$ 3,50 por hora lá fora. Ela faz sentido pra treinamento e fine-tuning de LLMs, inferência de modelos de 30B+ parâmetros e HPC. Pra inferência de modelos menores, Stable Diffusion, render ou VDI, uma L40S entrega o serviço por uma fração do custo. No Brasil, alugar em Real com NF costuma vencer a compra quando a GPU não fica ocupada 24/7 por mais de 18 a 24 meses.
Se você pesquisou "nvidia h100" é porque alguém na sua empresa falou em treinar um modelo, rodar um LLM interno ou o fornecedor de cloud mandou uma cotação com números que assustam. Este guia coloca a H100 no lugar dela: o que é, o que ela entrega, quanto custa comprar e alugar, e o principal, quando você não precisa dela.
O que é a NVIDIA H100
A H100 é a GPU de datacenter da geração Hopper, lançada em 2022 como sucessora da A100. O salto não foi só de FLOPS: ela trouxe o Transformer Engine com suporte a FP8, que é o que permite treinar e servir modelos de linguagem com o dobro de vazão da geração anterior sem perder qualidade perceptível. Existem três formatos que você vai encontrar em cotação:
- H100 SXM5: o módulo que vai em sistemas HGX de 4 ou 8 GPUs, com NVLink de 900 GB/s entre placas e 700 W por GPU. É a versão pra treinar modelo grande em várias GPUs.
- H100 PCIe: placa de slot, 350 W, memória HBM2e um pouco mais lenta. Cabe em servidor "normal" de 2U e é a mais comum em servidor dedicado com 1 a 4 GPUs.
- H100 NVL: par de placas PCIe com 94 GB cada, pensada pra inferência de LLM grande.
Especificações que importam (e as que não)
| Item | H100 SXM5 | H100 PCIe |
|---|---|---|
| Memória | 80 GB HBM3 | 80 GB HBM2e |
| Banda de memória | ~3,35 TB/s | ~2,0 TB/s |
| FP8 (Tensor, com sparsity) | ~3,9 PFLOPS | ~3,0 PFLOPS |
| FP16/BF16 (Tensor, com sparsity) | ~1,98 PFLOPS | ~1,5 PFLOPS |
| Interconexão | NVLink 900 GB/s | PCIe Gen5 (NVLink bridge opcional em pares) |
| Consumo | 700 W | 350 W |
| Onde aparece | Sistemas HGX 4x/8x | Servidor dedicado 1x a 4x |
Dois números decidem a maioria dos projetos: memória (o modelo cabe?) e banda de memória (inferência de LLM é limitada por banda, não por FLOPS). Um modelo de 70B parâmetros em FP16 ocupa ~140 GB só de pesos, ou seja, não cabe numa H100; em FP8 ou INT4 cabe em uma ou duas placas. É por isso que a H200, com 141 GB, virou a preferida pra servir modelo grande.
Pra que a H100 serve de verdade
- Treinamento e fine-tuning completo de modelos de 7B a 70B parâmetros (com várias GPUs e NVLink pra os maiores).
- Inferência de LLM em produção com muitos usuários simultâneos, onde FP8 e a banda HBM fazem diferença de custo por token.
- HPC e simulação (CFD, dinâmica molecular, risco financeiro) que usam FP64 tensor.
- Pipelines multimodais pesados: vídeo, embeddings em escala, modelos de difusão grandes.
O que não justifica uma H100: chatbot com modelo de 7B–13B quantizado pra 50 usuários, Stable Diffusion pra time de marketing, transcodificação de vídeo, render de arquitetura, VDI. Pra tudo isso a L40S ou a L4 resolve por bem menos.
Quanto custa a NVIDIA H100 em 2026
Faixas de referência de mercado internacional em setembro de 2026. Elas variam com câmbio, volume e fornecedor, e servem pra você calibrar uma cotação, não pra fechar orçamento.
| Forma | Referência (mercado internacional) | Observação |
|---|---|---|
| Comprar 1x H100 PCIe 80 GB | US$ 25 mil a US$ 35 mil | No Brasil, importada, some 60% a 100% de impostos e frete |
| Sistema HGX 8x H100 SXM | US$ 250 mil a US$ 400 mil | Mais rack, energia de 10 kW+, refrigeração e rede InfiniBand |
| Alugar por hora (cloud global) | US$ 2,00 a US$ 3,50/h | Preço caiu ~50% desde 2024 com a chegada da H200 e Blackwell |
| Alugar mensal em servidor dedicado | US$ 1.500 a US$ 2.500/GPU/mês | Cotado por projeto; no Brasil em Real com NF evita dólar e IOF |
A conta que quase ninguém faz: uma H100 PCIe consome 350 W e uma SXM 700 W, 24 horas por dia. Some UPS, refrigeração e o técnico que atualiza driver e firmware. Comprar só compensa quando a GPU fica ocupada acima de 60% do tempo por 18 a 24 meses. Abaixo disso, alugar sai mais barato e, no fim do ciclo, você troca pela geração seguinte sem ficar com um ativo depreciado.
H100 vs A100 vs H200: onde cada uma fica
- A100: geração anterior, sem FP8. Ainda boa pra treino FP16 de modelos médios e pra inferência multi-tenant com MIG, a preço bem menor. Detalhes em NVIDIA A100 em 2026: ainda vale? Preço 40 GB vs 80 GB.
- H100: o meio de campo em 2026. Melhor custo por FLOPS em treino, ampla disponibilidade, ecossistema maduro.
- H200: mesmo chip com 141 GB e 4,8 TB/s. Ganha em inferência de modelo grande e contexto longo; em treino compute-bound empata. Comparativo em NVIDIA H200 vs H100: o que muda, preço e quando vale.
- B200 (Blackwell): o topo, pra quem treina modelo de fundação. Pra 95% dos casos no Brasil é exagero, como explico em NVIDIA Blackwell (B200 e GB200): preço e quando faz sentido.
Alugar vs comprar no Brasil: o que muda aqui
Três coisas pesam mais no Brasil do que no exterior. A primeira é câmbio e IOF: contrato de cloud gringa vira uma linha variável no seu custo e uma explicação todo mês pro financeiro. A segunda é importação: comprar a placa exige processo, prazo e imposto que fazem o TCO subir muito acima da etiqueta. A terceira é latência e dado no país: inferência pra usuário brasileiro e dados sob LGPD ficam mais simples com a GPU em datacenter nacional.
Na prática, o caminho que a gente vê funcionar pra empresa brasileira: começar alugando a GPU certa pro caso (muitas vezes uma L40S, não uma H100), medir ocupação real por 2 ou 3 meses e só então decidir se vale um servidor dedicado com GPU mensal ou compra.
Perguntas frequentes
Uma H100 roda um modelo de 70B parâmetros?
Só quantizado. Em FP16 os pesos ocupam ~140 GB; em FP8 ficam ~70 GB e cabem em uma H100 de 80 GB com pouca folga pra contexto. Pra produção com contexto longo, use duas H100 com NVLink ou uma H200.
H100 PCIe ou SXM?
PCIe pra 1 a 4 GPUs em servidor dedicado, com custo e consumo menores. SXM quando você vai treinar em 8 GPUs com NVLink e precisa que elas conversem a 900 GB/s. Pra inferência, a diferença de desempenho raramente paga o preço do sistema HGX.
Quanto custa alugar uma H100 no Brasil?
Depende de dedicada ou compartilhada, mensal ou por hora, e do restante do servidor (CPU, RAM, NVMe). Como referência, o mercado internacional cobra US$ 2 a US$ 3,50 por hora. No Brasil, contrato mensal em Real com NF costuma ficar mais previsível que o equivalente em dólar.
Qual a alternativa mais barata pra inferência?
L40S (48 GB, FP8) pra modelos até ~30B quantizados e pra difusão; L4 pra modelos pequenos, vídeo e ambientes densos. Ambas custam uma fração da H100 e consomem bem menos energia.
A H100 está ficando obsoleta com Blackwell?
Não pro que a maioria das empresas faz. Blackwell mira treino de modelos de fundação e inferência de 400B+. A H100 segue como a GPU de melhor disponibilidade e custo por FLOPS pra treino e inferência de médio porte, e o preço de aluguel dela caiu justamente por isso.
Precisa de H100 (ou da GPU certa) no Brasil, em Real e com NF?
A Audaks dimensiona a GPU pro seu caso, treino, fine-tuning, inferência ou render, em datacenter Tier III em São Paulo, com suporte 24/7 em português. Conta o que você vai rodar e a gente responde com a configuração recomendada e a disponibilidade.
Falar com um especialista em GPU →Preferindo hardware inteiro só seu? Veja também servidor dedicado com GPU sob medida.
