Comparar preço de API de LLM em 2026 é mais difícil do que parece: cada fornecedor cobra em moeda diferente, conta entrada e saída em faixas diferentes, alguns dobram o preço acima de certo contexto e quase nenhum diz quanto custou aquela chamada. Este artigo resolve isso com números convertidos para reais, comparações por tarefa completa e código que você roda para medir o seu próprio caso.
Preços internacionais são os de tabela publicados em agosto de 2026. Conversão pelo dólar comercial de R$ 5,22 (14/08/2026). Para o custo real de quem paga do Brasil, somamos o IOF de 3,5% de compra internacional no cartão, chegando a um efetivo de R$ 5,40 por dólar. Os nossos preços já são publicados em reais e não passam por câmbio nem IOF de compra internacional. Os totais das tarefas usam as tarifas por milhão já arredondadas da Tabela 1. Preço de terceiro muda sem aviso — confirme na fonte antes de fechar orçamento.
Tabela 1 — Preço por milhão de tokens, tudo em reais
| Modelo | Entrada (R$/1M) | Saída (R$/1M) | Observação |
|---|---|---|---|
gpub-fast · DeepSeek V4 Flash | R$ 0,49 | R$ 1,09 | 1M de contexto |
gpub-mini · Qwen 3.6 35B | R$ 0,59 | R$ 3,49 | 200 mil de contexto |
gpub-plus · Qwen 3.8 27B | R$ 0,69 | R$ 3,99 | 250 mil de contexto |
gpub-base · GLM 5.2 | R$ 7,90 | R$ 17,90 | 200 mil de contexto |
gpub-max · Kimi K3 | R$ 17,90 | R$ 84,90 | 1M de contexto |
| Gemini 3.1 Pro (US$ 2 / 12) | R$ 10,81 | R$ 64,83 | Dobra acima de 200 mil tokens |
| GPT-5.6 Sol (US$ 5 / 30) | R$ 27,01 | R$ 162,08 | — |
| Claude Fable 5 (US$ 10 / 50) | R$ 54,03 | R$ 270,14 | — |
Valores de terceiros convertidos a R$ 5,40/US$ (dólar + IOF). A leitura rápida: gpub-plus sai 16× mais barato na saída que o Gemini 3.1 Pro e 68× mais barato que o Claude Fable 5; gpub-max, que é um modelo de fronteira aberto, sai 3,2× mais barato que o Fable 5 e 1,9× mais barato que o GPT-5.6 Sol.
Tabela 2 — O que importa: custo da tarefa inteira
Preço por token engana, porque cada tarefa tem uma proporção diferente entre entrada e saída. Comparar por trabalho completo é o único jeito honesto.
Tarefa A — Assistente de atendimento com RAG
50.000 perguntas por mês · 4.000 tokens de entrada (pergunta + trechos) · 400 de saída → 200M de entrada, 20M de saída.
| Modelo | Entrada | Saída | Total/mês | Por pergunta |
|---|---|---|---|---|
gpub-fast | R$ 98,00 | R$ 21,80 | R$ 119,80 | R$ 0,0024 |
gpub-plus | R$ 138,00 | R$ 79,80 | R$ 217,80 | R$ 0,0044 |
| Gemini 3.1 Pro | R$ 2.162,00 | R$ 1.296,60 | R$ 3.458,60 | R$ 0,069 |
gpub-max | R$ 3.580,00 | R$ 1.698,00 | R$ 5.278,00 | R$ 0,106 |
| GPT-5.6 Sol | R$ 5.402,00 | R$ 3.241,60 | R$ 8.643,60 | R$ 0,173 |
| Claude Fable 5 | R$ 10.806,00 | R$ 5.402,80 | R$ 16.208,80 | R$ 0,324 |
Mesmo trabalho, de R$ 119,80 a R$ 16.208,80 — uma diferença de 135×. Para atendimento com contexto recuperado, o modelo de fronteira quase nunca se justifica: a qualidade da resposta vem principalmente dos trechos que você recuperou, não do tamanho do modelo.
Tarefa B — Agente que lê a base de código
200 execuções por mês · 200.000 tokens de entrada · 5.000 de saída → 40M de entrada, 1M de saída.
| Modelo | Total/mês | Por execução | Ressalva |
|---|---|---|---|
gpub-plus | R$ 31,59 | R$ 0,16 | Contexto de 250 mil — cabe, mas sem folga |
| Gemini 3.1 Pro | R$ 961,65 | R$ 4,81 | Já na faixa dobrada, acima de 200 mil tokens |
gpub-max | R$ 800,90 | R$ 4,00 | 1M de contexto, sem faixa dobrada |
| GPT-5.6 Sol | R$ 1.242,48 | R$ 6,21 | — |
| Claude Fable 5 | R$ 2.431,34 | R$ 12,16 | — |
Repare na armadilha do preço por faixa de contexto: um agente que lê 200 mil tokens cruza exatamente o limite em que o Gemini dobra a tarifa. Duas linhas antes na tabela de preços, ele parecia o mais barato dos internacionais; na tarefa real, ficou mais caro que o gpub-max.
Meça o seu caso — o script
Nenhuma tabela substitui o seu prompt real. Este script roda a mesma tarefa em vários modelos, mede latência e custo, e imprime um comparativo. Como a nossa API devolve usage.cost_brl, o custo não é estimado: é o valor cobrado.
import time
from openai import OpenAI
cliente = OpenAI(api_key="gpub_live_suachaveaqui",
base_url="https://gpubrasil.com.br/v1")
MODELOS = ["gpub-fast", "gpub-mini", "gpub-plus", "gpub-base", "gpub-max"]
CASOS = [
{"nome": "classificacao", "sistema": "Classifique em: cobranca, acesso, bug, duvida.",
"usuario": "Paguei ontem e o sistema ainda diz que estou inadimplente.", "teto": 16},
{"nome": "extracao", "sistema": "Extraia CNPJ, numero e valor total. Responda so JSON.",
"usuario": "NF 1234, emitida por ACME LTDA CNPJ 00.000.000/0001-00, total R$ 1.234,56", "teto": 200},
{"nome": "raciocinio", "sistema": "Explique o passo a passo antes de concluir.",
"usuario": "Se 3 maquinas processam 300 itens em 2h, quanto tempo 5 maquinas levam para 1000?",
"teto": 1000}, # teto folgado: modelo de raciocinio gasta token pensando
]
print(f"{'caso':<14}{'modelo':<12}{'seg':>7}{'tokens':>9}{'R$':>12}")
for caso in CASOS:
for modelo in MODELOS:
t0 = time.time()
try:
r = cliente.chat.completions.create(
model=modelo,
messages=[{"role": "system", "content": caso["sistema"]},
{"role": "user", "content": caso["usuario"]}],
temperature=0,
max_tokens=caso["teto"],
)
except Exception as e:
print(f"{caso['nome']:<14}{modelo:<12} erro: {e}")
continue
dt = time.time() - t0
print(f"{caso['nome']:<14}{modelo:<12}{dt:>7.2f}"
f"{r.usage.total_tokens:>9}{r.usage.cost_brl:>12.6f}")
Rodar isso inteiro custa alguns centavos. Guarde a saída: ela é a base para decidir com dado em vez de manchete. E some a qualidade na conta — o mais barato que erra 20% das vezes não é barato.
API por token ou GPU dedicada? A conta do ponto de virada
Esta é a pergunta que mais recebemos, e ela tem resposta aritmética. Alugando GPU por hora, você paga a hora, não o token. Então a GPU empata com a API quando o seu volume de tokens por hora chega a:
tokens_por_segundo_de_equilibrio = preco_hora_gpu / (preco_saida_por_token * 3600)
| GPU | Preço/hora | Equilíbrio vs. gpub-plus (R$ 3,99/1M) | Equilíbrio vs. gpub-fast (R$ 1,09/1M) |
|---|---|---|---|
| RTX 5090 32 GB | R$ 4,77 | ~332 tokens/s sustentados | ~1.215 tokens/s |
| RTX 6000 Ada 48 GB | R$ 6,01 | ~418 tokens/s | ~1.532 tokens/s |
| RTX PRO 6000 96 GB | R$ 10,26 | ~714 tokens/s | ~2.615 tokens/s |
| H100 80 GB | R$ 17,89 | ~1.245 tokens/s | ~4.559 tokens/s |
Como ler: se você sustenta mais que o número da coluna, a GPU sai mais barata; se sustenta menos, o token vence. A conta considera só os tokens de saída, o que é conservador a favor da API — contando também a entrada, a GPU empata antes.
1. Confundir pico com média. "Meu servidor faz 2.000 tokens/s" costuma ser o pico com lote cheio. O que importa é a média das 24 horas, incluindo madrugada e fim de semana. Uma GPU ocupada 8 horas por dia custa, na prática, três vezes mais por token do que a conta acima sugere.
2. Esquecer o trabalho de operar. Servir modelo é serviço em produção: atualização, monitoramento, plantão, fila. Some esse custo antes de decidir. Se ninguém no time quer esse pager, a API por token já venceu.
Quando a GPU dedicada ganha, e ganha com folga
- Modelo próprio ou ajustado. Fine-tuning e LoRA só existem com os pesos na sua mão. Um 7B especializado no seu domínio costuma bater um modelo genérico muito maior — e roda numa placa barata.
- Volume alto e constante. Fila que não esvazia é o cenário perfeito para lote grande com vLLM.
- Controle de pesos, logs e retenção. Sistema de alto risco, auditoria, versão congelada para reprodução — assunto que detalhamos em EU AI Act e PL 2338 na prática.
- Trabalho que não é texto. Imagem, vídeo, voz, visão, treino. Nada disso é resolvido por API de texto.
Os custos que não aparecem na tabela de preço
| Custo escondido | Onde aparece | Como evitar |
|---|---|---|
| IOF de 3,5% | Fatura do cartão internacional | Pagar em reais, via Pix ou cartão nacional |
| Variação cambial | Entre orçar e pagar | Preço publicado em reais |
| Faixa de contexto dobrada | Acima de certo número de tokens | Conferir a faixa antes de projetar agente de contexto longo |
| Tokens de raciocínio | Saída que você não vê, mas paga | Medir com usage real, não com contagem do prompt |
| Resposta vazia por teto baixo | Cobrada mesmo assim | Teto folgado em modelo que raciocina (≥ 800 tokens no gpub-max) |
| Compromisso mínimo mensal | Contrato | Sem assinatura e sem mínimo de tokens aqui |
Resumo para quem só quer a resposta
- Tarefa objetiva em volume (classificar, extrair, moderar, rotear):
gpub-fastougpub-mini. É onde a diferença de preço vira ordem de grandeza. - Conversa, código e RAG do dia a dia:
gpub-plus. Melhor relação qualidade/preço do catálogo. - Raciocínio longo e contexto gigante:
gpub-max, com teto de saída folgado. - Volume alto e constante, modelo próprio ou dado sensível: GPU dedicada por hora.
- Na dúvida: rode o script deste artigo com os seus casos reais. Custa centavos e substitui semanas de discussão.
Compare com os seus próprios prompts
Cinco modelos, preços em reais, custo de cada chamada na resposta. E, se a conta virar, a GPU dedicada está no mesmo saldo.
Ver preços por token →Perguntas frequentes
Qual é a API de LLM mais barata em 2026 para quem paga em reais?
Depende da tarefa, mas a diferença é de ordem de grandeza. Num assistente de atendimento com RAG de 50 mil perguntas por mês, o mesmo trabalho custa R$ 119,80 com gpub-fast, R$ 217,80 com gpub-plus, R$ 3.458,60 com Gemini 3.1 Pro, R$ 8.643,60 com GPT-5.6 Sol e R$ 16.208,80 com Claude Fable 5, considerando o dólar a R$ 5,22 mais IOF de 3,5%.
Quando a GPU dedicada fica mais barata que a API por token?
Quando o volume sustentado passa do ponto de equilíbrio, calculado como preço da hora dividido pelo preço do token de saída vezes 3.600. Contra o gpub-plus, a R$ 3,99 por milhão de tokens de saída, uma RTX 5090 a R$ 4,77 por hora empata em torno de 332 tokens por segundo sustentados, e uma H100 a R$ 17,89 por hora empata perto de 1.245 tokens por segundo. O que conta é a média das 24 horas, não o pico.
Quais custos não aparecem na tabela de preços das APIs internacionais?
IOF de 3,5% na compra internacional no cartão, variação cambial entre orçar e pagar, faixa de contexto com preço dobrado acima de certo número de tokens, tokens de raciocínio que você paga sem ver, resposta vazia cobrada quando o teto de saída é baixo demais, e compromisso mínimo mensal em contrato.
Leia também: 10 casos de uso com código e custo real · Rodar modelos abertos sai mais barato que API? · Economia de tokens com self-hosting