Quem vem de geração de imagem leva um susto ao chegar em vídeo. A mesma placa que produz uma imagem em dois segundos leva vários minutos para produzir cinco segundos de vídeo. A conta muda de patamar, e o planejamento junto.
Este texto explica de onde vem esse custo, quanto ele dá em reais e — mais útil — como montar uma peça de vídeo sem pagar pelo caminho mais caro.
Por que vídeo custa tanto
Três multiplicadores empilhados:
- Quadros. Um segundo a 24 quadros por segundo são 24 imagens. Já começa 24 vezes mais caro.
- Coerência temporal. Os quadros não podem ser gerados isoladamente, ou o resultado pisca. O modelo processa blocos de quadros juntos, com atenção cruzando o tempo — e o custo dessa atenção cresce mais que linearmente com a duração.
- VRAM. Como o bloco inteiro precisa estar na memória, vídeo é uma das poucas cargas em que a placa de 24 GB fica pequena de verdade.
Um segundo de vídeo em resolução média custa, em tempo de GPU, algo entre 50 e 150 vezes uma imagem estática equivalente. É a razão pela qual "gerar um comercial de 30 segundos" não é um pedido, é um projeto.
Quanto tempo e quanto custa
Números de ordem de grandeza para modelos abertos de vídeo em geração a partir de imagem, numa placa de 45–48 GB:
| Configuração | Tempo de GPU | Custo do trecho |
|---|---|---|
| 5 s, 480p, 24 qps | ~2 a 4 min | R$ 0,25 a 0,50 (R$ 7,08/h) |
| 5 s, 720p, 24 qps | ~6 a 10 min | R$ 0,70 a 1,20 |
| 10 s, 720p, 24 qps | ~15 a 25 min | R$ 1,80 a 3,00 |
| 5 s, 1080p | Raramente vale — amplie depois | — |
Preços de agosto de 2026, para uma GPU avulsa, sem interrupção programada. O catálogo muda: confira a vitrine antes de fechar a conta.
Note a não linearidade: dobrar de 5 para 10 segundos mais que dobra o tempo. É a atenção temporal cobrando o preço dela — e é o motivo do pipeline da próxima seção.
O pipeline que sai mais barato
A tentação é pedir a peça inteira ao modelo. O caminho eficiente é outro, e ainda dá mais controle:
1. Roteirize em planos curtos
Uma peça de 30 segundos vira seis planos de 5 segundos. Cada plano é gerado separadamente, custa a faixa barata da tabela e pode ser refeito sozinho quando não ficar bom — em vez de rodar os 30 segundos de novo por causa de um trecho.
2. Gere a imagem-chave primeiro
Esta é a economia que quase ninguém faz. Em vez de gerar vídeo a partir de texto, gere uma imagem estática do primeiro quadro (custa centavos, itera em segundos), aprove a composição, o enquadramento e o personagem — e só então use essa imagem como ponto de partida do vídeo.
Vantagens: você itera na parte barata, o resultado fica muito mais previsível e a consistência entre planos melhora, porque as imagens-chave podem compartilhar a mesma semente e o mesmo estilo.
3. Gere em resolução média e amplie
Gerar em 480p ou 720p e ampliar depois com um modelo de super-resolução de vídeo custa uma fração de gerar direto em alta. A perda visual é pequena; a economia é de 3 a 5 vezes.
4. Monte com ferramenta de vídeo, não com IA
Cortes, transições, texto na tela, correção de cor e trilha são trabalho de edição — feitos por ffmpeg ou por um editor, em segundos e de graça. Pedir isso ao modelo generativo é caro e o resultado é pior.
# concatenar os planos gerados, na ordem
ffmpeg -f concat -safe 0 -i lista.txt -c copy bruto.mp4
# somar a narração e normalizar o áudio
ffmpeg -i bruto.mp4 -i narracao.wav \
-filter_complex "[1:a]loudnorm=I=-16:TP=-1.5[a]" \
-map 0:v -map "[a]" -c:v copy -c:a aac -shortest final.mp4
Modelos de vídeo não garantem que a mesma pessoa apareça igual em dois planos. Camisa muda de cor, rosto muda de idade, o cachorro fica com três patas.
O que ajuda: partir de imagens-chave derivadas da MESMA imagem base, manter descrição idêntica de roupa e cenário em todos os planos, e preferir cortes que não mostrem o mesmo rosto em sequência. O que não ajuda: insistir no mesmo texto esperando resultado diferente.
Escolher a placa
Vídeo é, junto com treino de modelo grande, o caso em que VRAM manda mais que velocidade:
| VRAM | O que dá para fazer | Placa típica |
|---|---|---|
| 24 GB | Trechos curtos em 480p, com aperto e descarregamento | RTX 4090 (R$ 2,78/h) |
| 45–48 GB | O ponto certo: 5 s em 720p com folga | L40S (R$ 7,08/h) |
| 80 GB | Trechos mais longos, resolução maior, lote | A100 80 GB (R$ 11,05/h) |
Em 24 GB dá para começar, mas você vai passar mais tempo contornando falta de memória do que produzindo. Se o projeto é sério, comece nos 45 GB.
Produza a peça e desligue
Placas de 45 GB e 80 GB por hora, cobradas em reais. Você paga as horas da produção, não um plano mensal.
Criar conta →A conta de uma peça de 30 segundos
Seis planos de 5 segundos, 720p, com iteração realista (três tentativas em média por plano, sendo duas descartadas ainda na fase de imagem-chave):
- Imagens-chave, com iteração: ~60 imagens ≈ R$ 0,20
- Geração de vídeo: 6 planos aprovados + 4 refeitos = 10 × ~8 min ≈ 1,3 h ≈ R$ 9,50
- Ampliação para 1080p: ~20 min ≈ R$ 2,40
- Narração e montagem: centavos
Cerca de R$ 12 em GPU para uma peça de 30 segundos. O custo verdadeiro do projeto é o tempo de quem dirige o resultado — que continua sendo trabalho humano e é onde a peça fica boa ou ruim.
Expectativas honestas
Vale dizer o que ainda não funciona bem, para você não descobrir depois de contratar o trabalho:
- Texto na tela gerado pelo modelo sai errado. Componha por cima, na edição.
- Mãos, dedos e objetos manipulados continuam sendo o ponto fraco. Evite closes de mão.
- Movimento de câmera complexo pedido em texto raramente sai como descrito. Prefira planos simples.
- Falas com lábios sincronizados exigem etapa própria de sincronia, não vêm do modelo de vídeo.
- Direitos de imagem. Não peça pessoa real identificável nem estilo de obra protegida; o problema aqui não é técnico.
Conclusão
Vídeo generativo saiu do território da demonstração, mas o caminho barato não é pedir a peça pronta. É roteirizar em planos curtos, iterar em imagens estáticas — que custam centavos —, gerar cada plano em resolução média, ampliar no fim e montar com ferramenta de edição.
Com esse pipeline, trinta segundos custam pouco mais de dez reais de GPU. Sem ele, você gasta o mesmo em uma única tentativa de gerar tudo de uma vez, e ainda descobre que o quarto segundo ficou errado.
Continue: vídeo com áudio sincronizado · imagens em escala · narração com IA