Das dez peças da parte 1, esta é a única acionada em todas as interações. Se você montar só ela, tem um produto. Se errar a conta dela, todas as outras somadas não salvam o seu custo.
1. O que tem dentro · 2. O cérebro ← você está aqui · 3. Os olhos (OCR) · 4. A memória (documentos) · 5. Imagem · 6. Vídeo · 7. Voz · 8. Ferramentas e agentes · 9. Juntando tudo e a conta
Token: a unidade que você compra
Modelo de linguagem não lê letra nem palavra: lê token, que é um pedaço de palavra. "Computador" pode virar dois tokens; "de" vira um; um nome próprio esquisito pode virar cinco.
A régua prática para o português: 1 token ≈ 4 caracteres, ou 1 palavra ≈ 1,5 token. Uma página A4 de texto corrido dá uns 700 tokens. Um contrato de 20 páginas, uns 15 mil.
Os modelos foram treinados majoritariamente em inglês, e o vocabulário de tokens reflete isso. O mesmo texto traduzido costuma gastar de 20% a 30% mais tokens em português.
Não é motivo para escrever prompt em inglês — a diferença de qualidade na compreensão do seu domínio pesa mais que a economia. Mas conta na hora de estimar volume: pegue a sua estimativa em inglês e some um quarto.
Por que a resposta custa mais que a pergunta
Olhe a tabela e repare que os dois números nunca são iguais:
| Modelo | Nome aberto | Contexto | Entrada (1 mi de tokens) | Saída (1 mi de tokens) |
|---|---|---|---|---|
gpub-fast | DeepSeek V4 Flash | 1.000.000 | R$ 0,49 | R$ 1,09 |
gpub-mini | Qwen 3.6 35B | 200.000 | R$ 0,59 | R$ 3,49 |
gpub-plus | Qwen 3.8 27B | 1.000.000 | R$ 0,69 | R$ 3,99 |
gpub-base | GLM 5.2 | 250.000 | R$ 7,90 | R$ 17,90 |
gpub-max | Kimi K3 | 1.000.000 | R$ 17,90 | R$ 84,90 |
Preços por milhão de tokens, em reais, de agosto de 2026. A tabela viva fica em gpubrasil.com.br/br/llm-api.html.
A diferença não é comercial, é física. A entrada é lida de uma vez: os 10 mil tokens do seu prompt entram na GPU numa única passada, todos em paralelo, e a placa faz o que ela faz de melhor.
A saída é gerada um token por vez. Para escrever a palavra 500 da resposta, o modelo precisa ter escrito as 499 anteriores e fazer mais uma passada completa por todos os seus bilhões de parâmetros. Quinhentos tokens de resposta são quinhentas passadas sequenciais.
Por isso a saída custa de duas a cinco vezes a entrada em todos os modelos, de todos os fornecedores do mundo. E por isso a instrução mais rentável que você pode colocar no seu sistema é "seja conciso".
A conta de uma conversa
Um assistente interno, pergunta típica com contexto de documentos recuperados:
| Item | Tokens | Com gpub-fast | Com gpub-plus | Com gpub-max |
|---|---|---|---|---|
| Instrução do sistema | 400 | — | — | — |
| Histórico da conversa | 1.200 | — | — | — |
| Trechos de documento | 2.500 | — | — | — |
| Pergunta do usuário | 80 | — | — | — |
| Total de entrada | 4.180 | R$ 0,00205 | R$ 0,00288 | R$ 0,0748 |
| Resposta gerada | 450 | R$ 0,00049 | R$ 0,00180 | R$ 0,0382 |
| Custo da mensagem | R$ 0,0025 | R$ 0,0047 | R$ 0,113 |
Traduzindo para escala de produto — 40 pessoas, 50 mensagens por dia cada, 22 dias úteis, num total de 44 mil mensagens no mês:
- No modelo econômico: R$ 112 por mês.
- No modelo intermediário: R$ 206 por mês.
- No modelo mais capaz do catálogo: R$ 4.973 por mês.
Quarenta e quatro vezes de diferença pelo mesmo produto. É aqui que a decisão de arquitetura vira decisão de negócio — e o assunto da parte 9 desta série.
A armadilha que mais estoura orçamento: o histórico
Esta é a parte que quase todo mundo descobre tarde. O modelo não lembra de nada. A cada mensagem, a sua aplicação reenvia a conversa inteira — porque é a única forma de o modelo saber do que se está falando.
Ou seja: na mensagem 20 de uma conversa, você está pagando pela mensagem 1 pela vigésima vez.
| Mensagem da conversa | Tokens enviados nessa mensagem | Total acumulado pago |
|---|---|---|
| 1ª | 500 | 500 |
| 5ª | 2.500 | 7.500 |
| 10ª | 5.000 | 27.500 |
| 20ª | 10.000 | 105.000 |
| 40ª | 20.000 | 410.000 |
Repare no formato: dobrar o tamanho da conversa quadruplica o que você pagou nela. Uma conversa longa de suporte, dessas de 40 idas e vindas, custa 400 mil tokens de entrada — o equivalente a mais de cinquenta conversas curtas de cinco mensagens.
Janela deslizante. Mande as últimas 8 a 10 mensagens, não as 40. Na maioria dos produtos ninguém percebe a diferença.
Resumo rolante. Quando a conversa passa de N mensagens, peça ao modelo mais barato um resumo de 200 tokens do que ficou para trás e substitua o histórico antigo por ele. Custa um centésimo do que economiza.
Corte o contexto recuperado. Se você anexa trechos de documento a cada pergunta (parte 4), mande 3 trechos bem escolhidos, não 15 por precaução. É o item que mais infla a entrada.
Janela de contexto: o que realmente cabe
Contexto é o teto de tokens de uma chamada — entrada mais saída. Os modelos do catálogo vão de 200 mil a 1 milhão de tokens, o que em papel é bastante coisa:
- 200 mil tokens ≈ 280 páginas ≈ um livro técnico inteiro.
- 1 milhão de tokens ≈ 1.400 páginas ≈ uma base de código de porte médio.
Mas duas ressalvas honestas. Primeira: caber não é entender. Todo modelo perde precisão no meio de contextos muito longos — a informação enterrada na página 400 é encontrada com menos confiabilidade que a da página 3. Segunda: contexto grande é caro por definição, porque contexto é entrada e entrada é cobrada. Enfiar 800 mil tokens numa pergunta simples é pagar R$ 14 por algo que sairia por centavos com busca bem feita.
Contexto largo é rede de segurança, não estratégia. A estratégia está na parte 4.
Como escolher entre os cinco
| Se a sua tarefa é... | Use | Por quê |
|---|---|---|
| Classificar, extrair campo, etiquetar, moderar | gpub-fast | Resposta curta e objetiva; o modelo mais barato acerta igual e você processa volume alto por quase nada |
| Conversar, atender, resumir, redigir | gpub-plus | O melhor equilíbrio da tabela — é a escolha padrão para a maioria dos produtos |
| Alto volume de tarefa objetiva com resposta média | gpub-mini | Rápido, barato e suficiente quando a saída não é longa |
| Análise densa, código não trivial, documento complexo | gpub-base | Sobe um degrau real de qualidade sem ir ao topo da tabela |
| Raciocínio longo, base de código inteira, o caso difícil | gpub-max | Maior capacidade do catálogo — use como exceção, não como padrão |
É o erro de custo número um, e ele é silencioso: funciona, ninguém reclama, e a conta chega quarenta vezes maior no fim do mês.
O caminho certo é o contrário: comece pelo mais barato e suba só onde a qualidade não bastar. Na prática, 80% a 90% das chamadas de um produto real são tarefas simples que o modelo econômico resolve. A parte 9 mostra como rotear isso automaticamente.
Na prática: o código
A API é compatível com o padrão OpenAI, então qualquer biblioteca, framework ou ferramenta que você já usa funciona trocando duas linhas — a URL base e a chave.
curl https://gpubrasil.com.br/v1/chat/completions \
-H "Authorization: Bearer gpub_live_suachaveaqui" \
-H "Content-Type: application/json" \
-d '{
"model": "gpub-plus",
"messages": [
{"role": "system", "content": "Você é o assistente interno da empresa. Responda em português, de forma direta e curta."},
{"role": "user", "content": "Resuma a política de reembolso em 3 tópicos."}
],
"max_tokens": 500
}'
Em Python, com a biblioteca oficial da OpenAI apontada para cá:
from openai import OpenAI
cliente = OpenAI(
base_url="https://gpubrasil.com.br/v1",
api_key="gpub_live_suachaveaqui",
)
fluxo = cliente.chat.completions.create(
model="gpub-plus",
messages=[
{"role": "system", "content": "Responda em português, de forma direta e curta."},
{"role": "user", "content": "Explique o que é um token, para um leigo."},
],
max_tokens=400,
stream=True, # a resposta chega palavra a palavra
)
for pedaco in fluxo:
conteudo = pedaco.choices[0].delta.content
if conteudo:
print(conteudo, end="", flush=True)
Sobre o stream=True
Não é enfeite: é a diferença entre um produto que parece rápido e um que parece travado. Sem fluxo contínuo, o usuário encara uma tela parada por 6 segundos até a resposta inteira chegar. Com fluxo, as primeiras palavras aparecem em menos de um segundo e a percepção de velocidade muda completamente — mesmo que o tempo total seja idêntico.
Custa o mesmo. Ligue sempre.
Duas defesas que valem no dia 1
- Sempre defina
max_tokens. É o seu freio de mão: sem ele, um prompt mal formulado gera uma resposta de 4 mil tokens e você paga por ela. - Nunca coloque a chave no navegador. A chamada sai do seu servidor. Chave em JavaScript de página pública é chave publicada — e quem achar gasta o seu saldo.
E quando vale ter a GPU só sua?
Vale — e a resposta honesta é: mais tarde do que a maioria imagina. O ponto de virada depende do porte do modelo que você quer servir, e são dois cenários bem diferentes:
| Cenário | Custo da máquina | Equivale a | Vira melhor negócio acima de |
|---|---|---|---|
| Modelo pequeno numa placa de 24 GB, ligada 24/7 | R$ 2,78/h ≈ R$ 2.030/mês | o modelo econômico da tabela | ~800 mil mensagens/mês |
| Modelo grande de ponta, em várias placas, 24/7 | a partir de ~R$ 15.700/mês | o modelo intermediário da tabela | ~5 milhões de mensagens/mês |
Ou seja: enquanto o seu produto não passa da casa do milhão de mensagens por mês, a placa dedicada é uma máquina cara ficando ociosa de madrugada.
Fora do volume, a GPU dedicada ainda ganha em duas situações:
- Modelo ajustado ao seu domínio — se você treinou um LoRA próprio, ele só roda na sua máquina.
- Exigência de isolamento — quando a política interna manda que o processamento aconteça numa instância dedicada só sua, com você controlando modelo, pesos e registros.
Fora desses casos, começar por token e migrar depois é quase sempre a decisão certa — e ela não te prende: como a API segue o padrão OpenAI, trocar para o seu próprio servidor mais tarde é mudar a URL base.
Teste antes de escrever qualquer código
O playground no painel roda os cinco modelos lado a lado, com uma amostra de teste de R$ 0,50 na primeira vez, e mostra o custo real de cada resposta. A chave de API é liberada após o primeiro depósito.
Ver a API por token →Próxima parte: os olhos — fazer o assistente ler imagem e PDF.
Continue: parte 4: a memória · cortar a conta de tokens · escolher o modelo certo