Resposta rápida
As três são GPUs da geração Ada Lovelace pra datacenter, com memória GDDR6 em vez de HBM. A L40S (48 GB, 350 W, com FP8) é a mais versátil: inferência de LLM até ~30B quantizado, Stable Diffusion, fine-tuning com LoRA e render. A L40 (48 GB, 300 W) mira gráficos, render e VDI. A L4 (24 GB, 72 W, single-slot) é a campeã de densidade: transcodificação de vídeo, inferência leve e muitos usuários por rack. Preços de referência em 2026: L40S US$ 7 mil a US$ 9 mil (aluguel US$ 0,80 a US$ 1,20/h), L4 US$ 2,5 mil a US$ 3 mil (US$ 0,40 a US$ 0,70/h). Pra treinar modelo grande, nenhuma das três substitui uma H100.
Se toda busca por GPU termina em H100, a maioria dos projetos brasileiros de IA termina em outra placa: uma L40S ou uma L4. Elas custam uma fração, consomem uma fração, e resolvem inferência, difusão, vídeo e render, que é o que a maior parte das empresas efetivamente roda. Este comparativo é pra escolher a certa.
As três lado a lado
| Item | L40S | L40 | L4 |
|---|---|---|---|
| Memória | 48 GB GDDR6 ECC | 48 GB GDDR6 ECC | 24 GB GDDR6 |
| Banda | ~864 GB/s | ~864 GB/s | ~300 GB/s |
| FP8 Tensor (com sparsity) | ~733 TFLOPS | ~362 TFLOPS | ~485 TFLOPS |
| FP16 Tensor (com sparsity) | ~362 TFLOPS | ~181 TFLOPS | ~242 TFLOPS |
| RT cores (render) | sim | sim | sim |
| Consumo | 350 W | 300 W | 72 W |
| Formato | PCIe dual-slot | PCIe dual-slot | PCIe single-slot, low-profile |
| Ponto forte | IA + gráfico, o canivete | render, VDI, Omniverse | densidade, vídeo, inferência leve |
L40S: a GPU que resolve a maioria dos casos
A L40S pegou o chip AD102 e o equipou pra IA: FP8 no Transformer Engine, 48 GB de memória e clocks altos. O que ela faz bem, na prática de quem opera:
- Inferência de LLM de 7B a 13B em FP16, e até ~30B quantizado em INT4/FP8, com dezenas de usuários simultâneos.
- Difusão (Stable Diffusion, SDXL, FLUX) e geração de imagem/vídeo em produção.
- Fine-tuning com LoRA/QLoRA de modelos médios, sem precisar de HBM.
- Render e Omniverse, porque mantém os RT cores da linha gráfica.
O limite dela é banda: 864 GB/s de GDDR6 contra 2 a 4,8 TB/s de HBM. Pra modelos de 70B em produção pesada, a H100 ou a H200 entregam mais tokens por segundo por placa. Comparação direta com Ampere em NVIDIA A100 em 2026: ainda vale? Preço 40 GB vs 80 GB.
L40: quando o trabalho é gráfico
Mesma memória da L40S, menos FP8 e menos consumo. É a escolha de quem monta VDI com aceleração gráfica (CAD, BIM, estações de projeto virtualizadas), render farm e streaming de aplicação 3D. Pra IA, a L40S custa pouco a mais e entrega o dobro em FP8; pra gráfico puro, a L40 basta.
L4: densidade e eficiência
72 W, um slot, sem cabo de energia extra: cabe em servidor 1U e em placas por rack em quantidade. Casos onde a L4 vence:
- Transcodificação e análise de vídeo (câmeras, streaming, moderação), com os encoders AV1/H.265 de hardware.
- Inferência leve e distribuída: modelos de visão, embeddings, LLMs pequenos (até ~8B quantizados) por equipe.
- VDI de escritório com aceleração modesta pra muitos usuários.
Quanto custam em 2026
| GPU | Comprar (referência internacional) | Alugar por hora (cloud global) | No Brasil |
|---|---|---|---|
| L40S | US$ 7 mil a US$ 9 mil | US$ 0,80 a US$ 1,20/h | Importada, some impostos; aluguel mensal em Real com NF evita câmbio |
| L40 | US$ 6 mil a US$ 8 mil | US$ 0,70 a US$ 1,00/h | Menos comum em nuvem; aparece em VDI e render |
| L4 | US$ 2,5 mil a US$ 3 mil | US$ 0,40 a US$ 0,70/h | A mais fácil de encontrar em VPS com GPU |
Quando subir pra A100 ou H100
Três sinais: o modelo não cabe em 48 GB nem quantizado; a latência por token na L40S estourou a meta mesmo com batch otimizado; ou você vai treinar (não só ajustar) um modelo de 13B+. Fora isso, a família Ada entrega mais resultado por real gasto, e é por onde a maioria dos projetos deveria começar. Se a dúvida é entre VM com GPU e hardware inteiro, veja VPS com GPU no Brasil: o que existe, quanto custa e quando usar.
Perguntas frequentes
L40S ou A100?
Inferência e difusão: L40S (FP8, mais barata, menos consumo). Treino FP16 de modelo médio ou HPC em FP64: A100. A L40S não tem FP64 útil.
A L40S roda um modelo de 70B?
Só quantizado em INT4 e com contexto curto, e sem folga. Pra 70B em produção, duas L40S com tensor-parallel ou uma H100/H200.
A L4 serve pra LLM?
Pra modelos pequenos (até ~8B quantizados) e pouca concorrência, sim. É excelente pra visão computacional e vídeo; pra chatbot com muitos usuários, suba pra L40S.
Preciso de NVLink nessas placas?
Não existe NVLink na linha Ada de datacenter. Multi-GPU roda via PCIe, o que basta pra inferência e fine-tuning; pra treino distribuído grande, é aí que a H100 SXM se justifica.
Inferência, difusão, vídeo ou render: qual placa cabe no seu orçamento?
A Audaks dimensiona a GPU pro caso, e é comum a resposta ser uma L40S ou uma L4, não uma H100. Datacenter Tier III em São Paulo, Real com NF, suporte 24/7 em português. Conta o que vai rodar e a gente diz a configuração e a disponibilidade.
Falar com um especialista em GPU →Preferindo hardware inteiro só seu? Veja também servidor dedicado com GPU sob medida.
Leitura relacionada
