Geração de imagem por IA parou de ser assunto de novidade e virou item de custo em agência, e-commerce e time de produto. A boa notícia de 2026 é que os modelos abertos alcançaram qualidade de produção — e rodam numa GPU alugada por hora, com custo por imagem na casa de frações de centavo. Este guia coloca lado a lado os três nomes que dominam a conversa hoje e mostra qual roda em qual placa, por quanto, e com qual licença.

⚡ Resumo

FLUX.2 é a referência de qualidade em pesos abertos, com geração nativa em até 4 MP. Qwen-Image 2.0 é o mais leve dos três — um desenho de ~7 bilhões de parâmetros com saída nativa em 2K e licença Apache 2.0 em algumas versões, o que o torna o mais amigável para uso comercial. HunyuanImage 3.0, da Tencent, é multimodal e autorregressivo: junta tokens de texto e imagem no mesmo modelo, o que melhora aderência ao prompt e conhecimento de mundo. Nenhum deles exige data center: a maioria dos fluxos cabe entre 12 e 24 GB de VRAM.

Os três, lado a lado

ModeloArquiteturaDestaqueOnde brilha
FLUX.2Diffusion TransformerGeração nativa até 4 MPCenas complexas, composição, iluminação, arte conceitual
Qwen-Image 2.0Difusão, ~7 B parâmetrosLeve, saída nativa 2KVolume alto, texto dentro da imagem, custo baixo
HunyuanImage 3.0Multimodal autorregressivoTexto e imagem no mesmo espaço de tokensAderência ao prompt, cena realista, conhecimento de mundo

Antes de escolher: leia a licença

É o erro mais caro dessa área. "Pesos abertos" não é sinônimo de uso comercial liberado: várias famílias publicam variantes com licenças diferentes — uma permissiva para uso livre e outra restrita a pesquisa. Antes de colocar uma imagem gerada num anúncio ou num catálogo de cliente, confira qual variante exata você baixou e o que a licença dela permite. Uma linha de leitura hoje evita um problema jurídico caro depois.

Qual GPU cada um pede

A regra prática: o consumo cresce com tamanho do modelo × resolução × quantidade de imagens no lote. Estas faixas cobrem a maioria dos fluxos:

Perfil de usoVRAM confortávelGPU sugeridaPreço/hora
Modelo leve (~7 B), 1K–2K, lote pequeno12–16 GBRTX 3090 24 GBR$ 1,27
Modelo de ponta, alta resolução, LoRA24 GBRTX 4090 24 GBR$ 2,78
Lote grande, upscaling no mesmo fluxo32–48 GBRTX 6000 Ada 48 GBR$ 6,01
Multimodal grande ou treino de LoRA pesado48–96 GBRTX 6000 Ada 48 GB / RTX PRO 6000 96 GBR$ 6,01 / R$ 10,26

Preços de catálogo em 15/08/2026, por hora, em reais, sujeitos a disponibilidade.

Quanto custa cada imagem, de verdade

A conta é direta e não depende de tabela de ninguém:

custo_por_imagem = (preco_hora / 3600) * segundos_por_imagem
imagens_por_real = 3600 / (preco_hora * segundos_por_imagem) * 1
GPUPreço/hora5 s/imagem10 s/imagem1.000 imagens a 10 s
RTX 3090 24 GBR$ 1,27R$ 0,0018R$ 0,0035R$ 3,53
RTX 4090 24 GBR$ 2,78R$ 0,0039R$ 0,0077R$ 7,72
RTX 6000 Ada 48 GBR$ 6,01R$ 0,0083R$ 0,0167R$ 16,69

Mil imagens por menos que um almoço, na placa certa. É esse número que muda a estratégia de conteúdo de um e-commerce: deixa de fazer sentido escolher quais produtos ganham foto de estilo — todos ganham.

💡 O que realmente encarece

Não é a GPU: é a máquina esquecida ligada. Um fluxo de imagem trabalha em rajada — você gera 300 peças em uma hora e some por três dias. Gere em lote, baixe o resultado, desligue. E lembre que a placa mais cara só vale se for proporcionalmente mais rápida: compare custo por imagem, nunca preço por hora.

Como subir em minutos

Três templates de 1 clique cobrem os perfis mais comuns:

Quatro usos que se pagam no primeiro mês

Catálogo de e-commerce

Foto de produto em fundo neutro vira cena de estilo de vida. Um catálogo de 5.000 itens sai por menos de R$ 40 em GPU, gerando dez segundos por imagem. O ganho de conversão de uma imagem contextualizada costuma pagar isso no primeiro dia.

Criativos para anúncio

Gerar 50 variações de um mesmo conceito e deixar o teste A/B decidir. Com custo por imagem em frações de centavo, a limitação passa a ser o tempo da equipe para revisar.

Identidade visual consistente com LoRA

Treinar um LoRA com o seu produto, sua mascote ou seu estilo é o que separa "imagem bonita" de "imagem da marca". Um treino leve cabe numa 4090; treinos maiores pedem 48 GB. Depois de pronto, todo mundo gera dentro do padrão.

Editorial e material de apoio

Blog, apresentação, sala de aula, material de treinamento. Substituir banco de imagens por geração própria elimina custo recorrente de licenciamento — e evita a foto genérica que todo mundo reconhece.

Mil imagens por menos de R$ 10 em GPU

Suba Fooocus, InvokeAI ou ComfyUI em 1 clique numa GPU por hora, em reais. Gere em lote e desligue.

Ver GPUs e templates →

Perguntas frequentes

Quais são os melhores modelos abertos de imagem em 2026?

FLUX.2 é a referência de qualidade em pesos abertos, com geração nativa em até 4 MP. Qwen-Image 2.0 é o mais leve, com cerca de 7 bilhões de parâmetros e saída nativa em 2K, e algumas versões da família usam licença Apache 2.0, o que facilita o uso comercial. HunyuanImage 3.0, da Tencent, é multimodal autorregressivo e se destaca em aderência ao prompt e realismo.

Quanta VRAM é necessária para gerar imagens?

Modelos leves de cerca de 7 bilhões de parâmetros rodam confortáveis em 12 a 16 GB. Modelos de ponta em alta resolução, com LoRA, pedem 24 GB. Lote grande com upscaling no mesmo fluxo pede 32 a 48 GB. Multimodais grandes ou treino pesado de LoRA pedem de 48 a 96 GB.

Quanto custa gerar mil imagens?

A conta é o preço por hora dividido por 3.600 e multiplicado pelos segundos por imagem. A dez segundos por imagem, mil imagens saem por cerca de R$ 3,53 numa RTX 3090 a R$ 1,27 por hora, R$ 7,72 numa RTX 4090 a R$ 2,78 por hora, ou R$ 16,69 numa RTX 6000 Ada de 48 GB a R$ 6,01 por hora.

Leia também: InvokeAI em 1 clique · Fooocus: Stable Diffusion sem complicação · Vídeo por IA na sua própria GPU