Audaks Cloud
INFRAESTRUTURA
9 min

NVIDIA H200 vs H100: O Que Muda, Preço e Quando Vale a Pena (2026)

A H200 é a H100 com 141 GB de HBM3e e 4,8 TB/s. Onde isso vira 1,5x a 1,9x mais tokens por segundo, onde não muda nada, quanto custa comprar e alugar em 2026 e como decidir entre H100, H200 e B200.

#nvidia h200#h200 vs h100#h200 preço#alugar nvidia h200#h200 141gb#gpu h200
infraestrutura
23 Set 2026·9 min de leitura

Resposta rápida

A NVIDIA H200 usa o mesmo chip de computação da H100, mas com 141 GB de memória HBM3e e 4,8 TB/s de banda (contra 80 GB e 3,35 TB/s). Como inferência de LLM é limitada por memória e banda, a H200 entrega de 1,5x a 1,9x mais tokens por segundo em modelos grandes e permite servir um modelo de 70B em FP16 com menos placas. Em treinamento limitado por computação, o ganho é pequeno. Preço de referência em 2026: US$ 30 mil a US$ 40 mil por unidade e US$ 3 a US$ 4,50 por hora em nuvem internacional. Vale a pena quando o gargalo é memória; se o seu caso roda bem em uma H100 (ou numa L40S), o dinheiro extra não vira resultado.

A pergunta que chega com mais frequência sobre a H200 é curta: "é muito melhor que a H100?". A resposta honesta é "depende do que você roda", e este post existe pra te dar o critério, não o marketing.

O que a H200 é (e o que ela não é)

A H200 não é uma arquitetura nova. É a placa Hopper da H100 com um pacote de memória muito melhor: HBM3e, 141 GB, 4,8 TB/s. FLOPS de FP8, FP16 e FP64 são os mesmos. Consumo é o mesmo (700 W no SXM). O que muda é a capacidade de manter o modelo inteiro e o cache de contexto perto do processador, e a velocidade com que a GPU lê esses dados.

ItemH100 SXMH200 SXM
ArquiteturaHopperHopper
Memória80 GB HBM3141 GB HBM3e
Banda de memória~3,35 TB/s~4,8 TB/s
FP8 / FP16 TensorIguaisIguais
NVLink900 GB/s900 GB/s
Consumo700 W700 W
Ganho em inferência LLM (70B+)base~1,5x a 1,9x
Ganho em treino compute-boundbase~0% a 10%

Onde a H200 ganha de verdade

  • Servir modelos grandes: um 70B em FP16 ocupa ~140 GB de pesos. Em duas H200 sobra memória pra contexto e batch; em H100 você precisa de mais placas ou de quantizar.
  • Contexto longo (32k, 128k tokens): o KV cache cresce com o contexto e o número de usuários. Memória e banda são exatamente o que a H200 tem a mais.
  • Batch maior por GPU: mais requisições simultâneas por placa reduz custo por token, que é a métrica que o financeiro vai olhar.
  • RAG e embeddings em escala, onde vários modelos ficam residentes na mesma GPU.

Onde não muda nada

Treinamento do zero e fine-tuning completo de modelos que já cabem na H100 são limitados por computação. Como os FLOPS são idênticos, o tempo de época é praticamente o mesmo. Se o seu time vai treinar, o dinheiro rende mais em mais H100 com NVLink do que em H200. Detalhes da H100 em NVIDIA H100 no Brasil: specs, preço e quando alugar em vez de comprar.

Quanto custa a H200 em 2026

FormaReferência (mercado internacional)Observação
Comprar 1x H200US$ 30 mil a US$ 40 milImportada no Brasil: some impostos e frete; oferta menor que a H100
Sistema HGX 8x H200US$ 300 mil a US$ 450 milMesma infraestrutura elétrica e térmica do HGX H100
Alugar por hora (cloud global)US$ 3,00 a US$ 4,50/hPrêmio de 30% a 50% sobre a H100
Alugar mensal dedicadacotado por projetoNo Brasil em Real com NF

Regra prática de custo: se a H200 permitir servir com metade das placas que você usaria de H100 (caso típico de 70B em FP16), ela sai mais barata no total mesmo custando 30% a 50% a mais por unidade. Se o modelo já cabe folgado em uma H100, o prêmio não se paga.

H100, H200 ou B200: como decidir

  • Modelo até ~30B, ou 70B quantizado, poucos usuários: H100, ou até uma L40S se for só inferência.
  • 70B em FP16, contexto longo, muitos usuários simultâneos: H200.
  • Treino de modelo de fundação, 400B+, MoE gigante: Blackwell B200/GB200, com o custo e a infraestrutura que isso implica.

Perguntas frequentes

A H200 substitui a H100?

Na prática, complementa. A NVIDIA vende as duas, e a H100 segue com melhor disponibilidade e preço. A H200 é a escolha quando memória e banda são o gargalo, que é o caso da inferência de modelos grandes.

Uma H200 roda um LLaMA 70B em FP16?

Uma só, não: os pesos ocupam ~140 GB e você precisa de espaço pro contexto. Duas H200 servem com folga; em FP8, uma H200 dá conta com contexto razoável.

Existe H200 PCIe?

Existe a H200 NVL (PCIe, 141 GB) em pares com ponte NVLink, voltada a servidores convencionais de inferência. É o formato que aparece em servidor dedicado de 2 ou 4 GPUs.

Vale esperar a Blackwell em vez de contratar H200?

Se o seu caso é inferência de médio porte, não. Blackwell tem preço, consumo (1.000 W+) e disponibilidade de outro patamar. H200 resolve hoje, e o aluguel dela tende a cair conforme a Blackwell entra.

Não sabe se o seu modelo pede H100 ou H200?

Manda o modelo, a precisão (FP16/FP8/INT4), o contexto e o número de usuários simultâneos. A Audaks dimensiona a GPU e o servidor em volta dela, em datacenter Tier III em São Paulo, em Real e com NF, e te diz a disponibilidade.

Falar com um especialista em GPU →

Preferindo hardware inteiro só seu? Veja também servidor dedicado com GPU sob medida.

Pronto para migrar para a nuvem?

Nossa equipe esta pronta para ajudar voce nessa jornada. Agende uma consultoria gratuita.