Resposta rápida
Blackwell é a arquitetura de GPU da NVIDIA que sucede a Hopper (H100/H200). A B200 traz dois dies num só pacote, até 192 GB de HBM3e com ~8 TB/s, precisão FP4 no Transformer Engine de 2ª geração e NVLink de 1,8 TB/s, ao custo de ~1.000 W por GPU. O GB200 NVL72 junta 72 GPUs e 36 CPUs Grace num rack com refrigeração líquida. Preço de referência em 2026: US$ 35 mil a US$ 45 mil por B200, sistemas de 8 GPUs acima de US$ 400 mil, aluguel de US$ 5 a US$ 7 por hora lá fora e caindo. Faz sentido pra treinar modelos de fundação e servir modelos de 400B+ ou MoE gigantes. Pra inferência e fine-tuning de médio porte no Brasil, H100, H200 ou L40S entregam o resultado por muito menos.
"Blackwell" virou palavra de busca porque virou manchete: os maiores modelos do mundo estão sendo treinados nela. A pergunta útil pra uma empresa brasileira não é "quão rápida ela é", e sim "em que ponto o meu problema justifica esse patamar de custo, energia e complexidade". Este post responde isso sem torcida.
O que muda de Hopper pra Blackwell
| Item | H100 (Hopper) | H200 (Hopper) | B200 (Blackwell) |
|---|---|---|---|
| Memória | 80 GB HBM3 | 141 GB HBM3e | até 192 GB HBM3e |
| Banda de memória | ~3,35 TB/s | ~4,8 TB/s | ~8 TB/s |
| Precisões novas | FP8 | FP8 | FP4 (Transformer Engine 2ª ger.) |
| NVLink | 900 GB/s | 900 GB/s | 1,8 TB/s |
| Consumo por GPU | 700 W | 700 W | ~1.000 W |
| Refrigeração típica | ar | ar | ar (HGX) ou líquida (NVL72) |
| Ganho em inferência LLM grande (fabricante) | base | ~1,5x a 1,9x | até várias vezes com FP4 |
O ganho em inferência de modelo gigante vem principalmente do FP4 e da memória, e é real pra quem serve modelos de centenas de bilhões de parâmetros. Pra um 13B ou um 70B quantizado, o salto sobre H200 é bem menor do que o marketing sugere, porque esses modelos já não são limitados pela GPU no mesmo grau.
B200, GB200 e NVL72: os formatos
- HGX B200: 8 GPUs num sistema refrigerado a ar, o "servidor de IA" tradicional, agora com 8 a 10 kW só de GPU.
- GB200 Superchip: duas B200 ligadas a uma CPU Grace (ARM), pra quem quer memória unificada CPU+GPU.
- GB200 NVL72: 72 GPUs e 36 CPUs num rack único com refrigeração líquida e ~120 kW. É infraestrutura de hyperscaler, não de sala de servidores.
Quanto custa Blackwell em 2026
| Forma | Referência (mercado internacional) | Observação |
|---|---|---|
| 1x B200 | US$ 35 mil a US$ 45 mil | Oferta ainda restrita; prazos longos |
| HGX 8x B200 | US$ 400 mil a US$ 550 mil | Mais rede, energia e refrigeração dimensionadas pra 10 kW+ de GPU |
| GB200 NVL72 | milhões de dólares por rack | Exige refrigeração líquida e projeto elétrico próprio |
| Alugar por hora (cloud global) | US$ 5 a US$ 7/h | Caindo conforme a oferta cresce |
A realidade no Brasil
Três fatores tornam Blackwell um caso raro por aqui. Energia: 1.000 W por GPU, 8 a 10 kW por servidor, algo que a maioria dos datacenters nacionais só entrega em racks específicos. Importação: preço, prazo e impostos sobre um ativo que se deprecia rápido. Necessidade: a esmagadora maioria das cargas de IA em empresas brasileiras é inferência de modelos de até 70B, RAG, difusão e visão computacional. Tudo isso roda bem, e mais barato, em H100, H200 ou L40S.
Quando Blackwell faz sentido: você treina modelo próprio de grande porte, serve um modelo de 400B+ ou MoE com SLA de latência agressivo, ou pesquisa em escala. Nesse caso, a conversa é de projeto, com cotação, prazo e infraestrutura elétrica planejados.
Perguntas frequentes
B200 ou H200 pra inferência?
H200 pra a maioria dos modelos até 70B. B200 quando o modelo é de centenas de bilhões de parâmetros, o FP4 é aceitável pro seu caso e o custo por token justifica o prêmio.
Blackwell deixa a H100 obsoleta?
Não. Ela desloca a H100 pra baixo na escada de preço, o que é bom pra quem aluga: H100 e H200 ficaram mais baratas exatamente por causa da Blackwell.
Existe Blackwell em servidor dedicado no Brasil?
Existe em projeto, com prazo e infraestrutura elétrica dimensionada. Não é um item de prateleira; a Audaks avalia caso a caso e informa a disponibilidade na cotação.
O que é FP4?
Uma precisão de 4 bits com escalonamento inteligente no Transformer Engine. Reduz memória e aumenta vazão em inferência de modelos muito grandes, com perda de qualidade controlada. Pra modelos pequenos, o ganho prático é menor.
Precisa de projeto de GPU em grande escala, ou só da placa certa pro seu caso?
Na maioria dos projetos brasileiros a resposta é H100, H200 ou L40S. Quando é Blackwell, é projeto com prazo e infraestrutura. Conta o que vai rodar e a Audaks te diz o que faz sentido, com disponibilidade e cotação em Real.
Falar com um especialista em GPU →Preferindo hardware inteiro só seu? Veja também servidor dedicado com GPU sob medida.
Leitura relacionada
