"Preciso de um servidor com 8 GPUs." Quando a gente pergunta para quê, a resposta mais comum revela um problema que uma placa resolve — e às vezes uma placa de R$ 3 por hora.

Vale separar os três motivos possíveis, porque eles têm soluções completamente diferentes e só o primeiro exige mesmo várias placas juntas.

Motivo 1 — o modelo não cabe

Este é o caso legítimo e o único que obriga várias GPUs na mesma máquina, com interligação rápida entre elas.

Mas antes de aceitar, faça a conta com quantização. Usando a fórmula de VRAM:

Modelo16 bits8 bits4 bitsCabe em uma placa?
8B19 GB10 GB5 GBSim, até em 16 GB
32B77 GB38 GB19 GBSim em 4 bits, numa de 24 GB
70B168 GB84 GB42 GBSim em 4 bits, numa de 48 GB
~120B288 GB144 GB72 GBEm 4 bits, numa de 80 GB — no limite
~250B ou mais600 GB+300 GB+150 GB+Não. Aqui sim, várias placas

Ou seja: até 70 bilhões de parâmetros, uma placa resolve se você aceitar 4 bits — e, na maioria das tarefas, a perda não é mensurável. O pedido de oito placas costuma virar um pedido de uma, mais barata que o servidor inteiro.

💡 Antes de pedir mais placas, responda

Você já testou o modelo quantizado nos seus casos reais? Se a resposta for não, teste primeiro. Uma hora de GPU e trinta casos respondem uma decisão de milhares de reais por mês.

Quando é mesmo necessário

Modelos realmente gigantes só rodam distribuídos, dividindo as camadas entre as placas (tensor parallel). Três coisas para saber:

vllm serve Org/Modelo-Gigante \
  --tensor-parallel-size 8 \
  --max-model-len 8192 \
  --gpu-memory-utilization 0.92

Motivo 2 — o treino demora

Aqui várias placas ajudam, mas a pergunta anterior é: demora quanto, e isso é um problema?

Ajuste com LoRA de um modelo de 8B com mil exemplos leva menos de uma hora numa placa só. Dividir em quatro para terminar em vinte minutos não muda a vida de ninguém e adiciona complexidade real.

Várias placas se justificam em treino quando:

⚠️ Multi-GPU em treino não é linear

Quatro placas raramente rendem 4×. Entre 2,8× e 3,5× é o normal, por causa da sincronização de gradientes a cada passo. Em treino pequeno, o custo fixo de coordenação pode comer todo o ganho.

Meça com uma fração do conjunto antes de comprometer o treino inteiro num nó caro.

Motivo 3 — a vazão não dá conta

Este é o caso em que a resposta certa é quase sempre várias máquinas independentes, não várias placas na mesma máquina.

Se o modelo cabe numa GPU e o problema é atender mais gente, você não precisa de paralelismo interno — precisa de mais cópias do mesmo servidor, com um balanceador na frente:

AbordagemCustoTolerância a falhaComplexidade
1 máquina com 4 GPUs em paralelo internoAlto (nó fechado)Baixa — cai tudo juntoMédia
4 máquinas de 1 GPU com balanceadorMenor, e elásticoAlta — cai uma, sobram trêsBaixa

A segunda linha ganha em quase tudo. E permite algo que a primeira não permite: ligar e desligar máquinas conforme a demanda — três no horário comercial, uma de madrugada. Em carga que varia ao longo do dia, isso corta a conta pela metade.

O paralelismo interno só ganha quando o modelo não cabe numa placa. Fora disso, ele é uma forma cara de comprar fragilidade.

A árvore de decisão

  1. O modelo em 4 bits cabe numa placa disponível? Sim → uma placa. Pare aqui.
  2. Não cabe, mas um modelo menor resolveria a tarefa? Teste com os seus casos. Muitas vezes resolve — e a diferença de custo é de dez vezes.
  3. Precisa mesmo do modelo grande? Então várias GPUs no mesmo nó, com potência de 2.
  4. O problema é vazão, com o modelo cabendo? Várias máquinas de 1 GPU, com balanceador.
  5. O problema é tempo de treino acima de 12 h? Multi-GPU no mesmo nó, medindo o ganho real antes.

A conta que costuma decidir

Servir um modelo de 70B para uma equipe, oito horas por dia:

OpçãoConfiguraçãoCusto/horaMês (176 h)
Quantizado em 4 bits1 placa de 48 GBa partir de R$ 5,87~R$ 1.033
Em 8 bits1 placa de 96 GBa partir de R$ 10,34~R$ 1.820
Em 16 bits2 placas de 96 GB~R$ 20,68~R$ 3.640

Preços de agosto de 2026, para uma GPU avulsa, sem interrupção programada. O catálogo muda: confira a vitrine antes de fechar a conta.

Três vezes e meia de diferença entre a primeira e a última linha, para um modelo que, em 4 bits, a maioria dos usuários não distingue do original. É a decisão de arquitetura com maior impacto financeiro em todo o projeto.

Comece por uma placa e meça

Placas de 24, 48 e 96 GB por hora, cobradas em reais. Suba, teste os seus casos e só então decida o tamanho do compromisso.

Criar conta →

Erros comuns

Conclusão

A pergunta "quantas GPUs eu preciso?" quase sempre tem a mesma resposta: uma, com o modelo quantizado — e a resposta certa custa dez vezes menos que a intuitiva.

Várias placas no mesmo nó se justificam em dois casos: modelo que não cabe de jeito nenhum e treino longo de verdade. Para vazão, a escala é horizontal — mais máquinas pequenas, que ainda por cima você pode desligar quando a demanda cair.

Continue: quantização e VRAM · dimensionar vazão · trabalho em lote