Resposta rápida
A NVIDIA H200 usa o mesmo chip de computação da H100, mas com 141 GB de memória HBM3e e 4,8 TB/s de banda (contra 80 GB e 3,35 TB/s). Como inferência de LLM é limitada por memória e banda, a H200 entrega de 1,5x a 1,9x mais tokens por segundo em modelos grandes e permite servir um modelo de 70B em FP16 com menos placas. Em treinamento limitado por computação, o ganho é pequeno. Preço de referência em 2026: US$ 30 mil a US$ 40 mil por unidade e US$ 3 a US$ 4,50 por hora em nuvem internacional. Vale a pena quando o gargalo é memória; se o seu caso roda bem em uma H100 (ou numa L40S), o dinheiro extra não vira resultado.
A pergunta que chega com mais frequência sobre a H200 é curta: "é muito melhor que a H100?". A resposta honesta é "depende do que você roda", e este post existe pra te dar o critério, não o marketing.
O que a H200 é (e o que ela não é)
A H200 não é uma arquitetura nova. É a placa Hopper da H100 com um pacote de memória muito melhor: HBM3e, 141 GB, 4,8 TB/s. FLOPS de FP8, FP16 e FP64 são os mesmos. Consumo é o mesmo (700 W no SXM). O que muda é a capacidade de manter o modelo inteiro e o cache de contexto perto do processador, e a velocidade com que a GPU lê esses dados.
| Item | H100 SXM | H200 SXM |
|---|---|---|
| Arquitetura | Hopper | Hopper |
| Memória | 80 GB HBM3 | 141 GB HBM3e |
| Banda de memória | ~3,35 TB/s | ~4,8 TB/s |
| FP8 / FP16 Tensor | Iguais | Iguais |
| NVLink | 900 GB/s | 900 GB/s |
| Consumo | 700 W | 700 W |
| Ganho em inferência LLM (70B+) | base | ~1,5x a 1,9x |
| Ganho em treino compute-bound | base | ~0% a 10% |
Onde a H200 ganha de verdade
- Servir modelos grandes: um 70B em FP16 ocupa ~140 GB de pesos. Em duas H200 sobra memória pra contexto e batch; em H100 você precisa de mais placas ou de quantizar.
- Contexto longo (32k, 128k tokens): o KV cache cresce com o contexto e o número de usuários. Memória e banda são exatamente o que a H200 tem a mais.
- Batch maior por GPU: mais requisições simultâneas por placa reduz custo por token, que é a métrica que o financeiro vai olhar.
- RAG e embeddings em escala, onde vários modelos ficam residentes na mesma GPU.
Onde não muda nada
Treinamento do zero e fine-tuning completo de modelos que já cabem na H100 são limitados por computação. Como os FLOPS são idênticos, o tempo de época é praticamente o mesmo. Se o seu time vai treinar, o dinheiro rende mais em mais H100 com NVLink do que em H200. Detalhes da H100 em NVIDIA H100 no Brasil: specs, preço e quando alugar em vez de comprar.
Quanto custa a H200 em 2026
| Forma | Referência (mercado internacional) | Observação |
|---|---|---|
| Comprar 1x H200 | US$ 30 mil a US$ 40 mil | Importada no Brasil: some impostos e frete; oferta menor que a H100 |
| Sistema HGX 8x H200 | US$ 300 mil a US$ 450 mil | Mesma infraestrutura elétrica e térmica do HGX H100 |
| Alugar por hora (cloud global) | US$ 3,00 a US$ 4,50/h | Prêmio de 30% a 50% sobre a H100 |
| Alugar mensal dedicada | cotado por projeto | No Brasil em Real com NF |
Regra prática de custo: se a H200 permitir servir com metade das placas que você usaria de H100 (caso típico de 70B em FP16), ela sai mais barata no total mesmo custando 30% a 50% a mais por unidade. Se o modelo já cabe folgado em uma H100, o prêmio não se paga.
H100, H200 ou B200: como decidir
- Modelo até ~30B, ou 70B quantizado, poucos usuários: H100, ou até uma L40S se for só inferência.
- 70B em FP16, contexto longo, muitos usuários simultâneos: H200.
- Treino de modelo de fundação, 400B+, MoE gigante: Blackwell B200/GB200, com o custo e a infraestrutura que isso implica.
Perguntas frequentes
A H200 substitui a H100?
Na prática, complementa. A NVIDIA vende as duas, e a H100 segue com melhor disponibilidade e preço. A H200 é a escolha quando memória e banda são o gargalo, que é o caso da inferência de modelos grandes.
Uma H200 roda um LLaMA 70B em FP16?
Uma só, não: os pesos ocupam ~140 GB e você precisa de espaço pro contexto. Duas H200 servem com folga; em FP8, uma H200 dá conta com contexto razoável.
Existe H200 PCIe?
Existe a H200 NVL (PCIe, 141 GB) em pares com ponte NVLink, voltada a servidores convencionais de inferência. É o formato que aparece em servidor dedicado de 2 ou 4 GPUs.
Vale esperar a Blackwell em vez de contratar H200?
Se o seu caso é inferência de médio porte, não. Blackwell tem preço, consumo (1.000 W+) e disponibilidade de outro patamar. H200 resolve hoje, e o aluguel dela tende a cair conforme a Blackwell entra.
Não sabe se o seu modelo pede H100 ou H200?
Manda o modelo, a precisão (FP16/FP8/INT4), o contexto e o número de usuários simultâneos. A Audaks dimensiona a GPU e o servidor em volta dela, em datacenter Tier III em São Paulo, em Real e com NF, e te diz a disponibilidade.
Falar com um especialista em GPU →Preferindo hardware inteiro só seu? Veja também servidor dedicado com GPU sob medida.
Leitura relacionada
- NVIDIA H100 no Brasil: specs, preço e quando alugar em vez de comprar
- NVIDIA Blackwell (B200 e GB200): preço e quando faz sentido
- NVIDIA L40S vs L40 vs L4: qual GPU pra inferência, render e VDI
- Cloud GPU pra machine learning e treinamento de IA no Brasil
- GPU cloud vs GPU em servidor dedicado: quando cada um
