Resposta rápida
A NVIDIA A100 (arquitetura Ampere, 2020) existe em versões de 40 GB e 80 GB HBM2e e continua sendo, em 2026, a GPU de melhor custo por TFLOPS em FP16/BF16 pra treinar modelos médios e pra inferência multi-tenant com MIG. O que ela não tem é FP8, o que deixa H100, H200 e L40S bem mais eficientes em inferência de LLM. Preço de referência: US$ 10 mil a US$ 17 mil nova (80 GB), US$ 6 mil a US$ 9 mil usada, e US$ 1 a US$ 1,80 por hora em nuvem internacional. Vale pra treino FP16, HPC em FP64 e fatiamento em até 7 instâncias; pra inferência de LLM, a L40S costuma sair melhor por real gasto.
Por que um chip de 2020 ainda aparece em toda proposta de GPU em 2026? Porque a A100 envelheceu bem: memória HBM rápida, FP64 real pra HPC e o recurso de dividir a placa em até sete GPUs menores. Mas ela perdeu uma corrida importante, a do FP8, e é isso que define onde ela ainda vale.
A100 40 GB vs 80 GB
| Item | A100 40 GB | A100 80 GB |
|---|---|---|
| Memória | 40 GB HBM2e | 80 GB HBM2e |
| Banda | ~1,55 TB/s | ~2,0 TB/s |
| FP16/BF16 Tensor (com sparsity) | ~624 TFLOPS | ~624 TFLOPS |
| TF32 Tensor | ~312 TFLOPS | ~312 TFLOPS |
| FP64 Tensor | ~19,5 TFLOPS | ~19,5 TFLOPS |
| FP8 | não | não |
| MIG | até 7 instâncias | até 7 instâncias |
| Consumo | 250 W (PCIe) / 400 W (SXM) | 300 W (PCIe) / 400 W (SXM) |
Se for A100, prefira a de 80 GB: a diferença de preço é pequena diante do que a memória extra permite (batch maior, modelos de 13B em FP16 numa placa só, contexto mais longo).
Onde a A100 ainda é a melhor escolha
- Treinamento e fine-tuning em FP16/BF16 de modelos até ~13B por placa (mais com várias GPUs). Custo por hora baixo e ecossistema maduro.
- HPC e simulação: FP64 tensor de 19,5 TFLOPS, algo que a L40S e a L4 simplesmente não têm.
- Inferência multi-tenant: com MIG você entrega sete GPUs isoladas pra sete equipes ou clientes a partir de uma placa, útil pra software house e MSP.
- Orçamento limitado pra treino: uma A100 80 GB usada custa menos que um terço de uma H100 nova.
Onde ela perde
Inferência de LLM em produção. Sem FP8, a A100 precisa de mais memória e mais tempo por token que a H100 e que a L40S, que custa menos e consome menos. Se o seu caso é servir chatbot ou API de modelo, a A100 raramente é a melhor escolha em 2026. Pra treino grande, a H100 entrega 2x a 3x mais por placa.
Quanto custa a A100 em 2026
| Forma | Referência (mercado internacional) | Observação |
|---|---|---|
| Comprar 1x A100 80 GB nova | US$ 10 mil a US$ 17 mil | Estoque novo em queda; o mercado migrou pra Hopper |
| Comprar usada / recondicionada | US$ 6 mil a US$ 9 mil | Verificar garantia e horas de uso; ex-cloud aparece muito |
| Alugar por hora (cloud global) | US$ 1,00 a US$ 1,80/h | Metade do preço da H100 |
| Alugar mensal dedicada | cotado por projeto | Em Real com NF no Brasil |
Aviso de compra: A100 usada é o item mais vendido do mercado secundário de GPU. Placas ex-datacenter podem ter 3 ou 4 anos de operação contínua. Exija teste de memória e garantia, ou alugue e deixe o risco com quem opera.
Perguntas frequentes
A100 ou L40S pra inferência?
L40S na maioria dos casos: tem FP8, 48 GB e custa menos. A100 só quando você precisa de HBM (banda) pra modelos maiores em FP16 e não quer pagar por H100.
A100 ou H100 pra treinar?
H100 se o orçamento permitir: 2x a 3x mais rápida no mesmo tempo de aluguel, e com FP8 no Transformer Engine. A100 quando o custo por hora é o limitador e o modelo é médio.
O que é MIG na A100?
Multi-Instance GPU: divide a placa em até 7 instâncias isoladas, cada uma com memória e computação garantidas. Serve pra dar GPU a vários times ou clientes sem eles se atrapalharem.
Ainda faz sentido comprar A100 em 2026?
Só usada, barata e pra um uso que você sabe que vai ocupar a placa (HPC, treino contínuo). Pra qualquer outro caso, alugar a GPU certa custa menos que carregar uma placa de 2020 no ativo.
Quer saber se a A100 resolve o seu caso ou se vale subir pra Hopper?
Descreve o que vai rodar (treino, HPC, inferência, quantos usuários) e a Audaks dimensiona a GPU e o servidor, em datacenter Tier III em São Paulo, em Real com NF. Sem empurrar a placa mais cara.
Falar com um especialista em GPU →Preferindo hardware inteiro só seu? Veja também servidor dedicado com GPU sob medida.
Leitura relacionada
