Das dez peças da parte 1, esta é a única acionada em todas as interações. Se você montar só ela, tem um produto. Se errar a conta dela, todas as outras somadas não salvam o seu custo.

📚 Série "Monte o seu próprio ChatGPT" — 9 partes

1. O que tem dentro · 2. O cérebro ← você está aqui · 3. Os olhos (OCR) · 4. A memória (documentos) · 5. Imagem · 6. Vídeo · 7. Voz · 8. Ferramentas e agentes · 9. Juntando tudo e a conta

Token: a unidade que você compra

Modelo de linguagem não lê letra nem palavra: lê token, que é um pedaço de palavra. "Computador" pode virar dois tokens; "de" vira um; um nome próprio esquisito pode virar cinco.

A régua prática para o português: 1 token ≈ 4 caracteres, ou 1 palavra ≈ 1,5 token. Uma página A4 de texto corrido dá uns 700 tokens. Um contrato de 20 páginas, uns 15 mil.

🇧🇷 Português custa mais caro que inglês

Os modelos foram treinados majoritariamente em inglês, e o vocabulário de tokens reflete isso. O mesmo texto traduzido costuma gastar de 20% a 30% mais tokens em português.

Não é motivo para escrever prompt em inglês — a diferença de qualidade na compreensão do seu domínio pesa mais que a economia. Mas conta na hora de estimar volume: pegue a sua estimativa em inglês e some um quarto.

Por que a resposta custa mais que a pergunta

Olhe a tabela e repare que os dois números nunca são iguais:

ModeloNome abertoContextoEntrada (1 mi de tokens)Saída (1 mi de tokens)
gpub-fastDeepSeek V4 Flash1.000.000R$ 0,49R$ 1,09
gpub-miniQwen 3.6 35B200.000R$ 0,59R$ 3,49
gpub-plusQwen 3.8 27B1.000.000R$ 0,69R$ 3,99
gpub-baseGLM 5.2250.000R$ 7,90R$ 17,90
gpub-maxKimi K31.000.000R$ 17,90R$ 84,90

Preços por milhão de tokens, em reais, de agosto de 2026. A tabela viva fica em gpubrasil.com.br/br/llm-api.html.

A diferença não é comercial, é física. A entrada é lida de uma vez: os 10 mil tokens do seu prompt entram na GPU numa única passada, todos em paralelo, e a placa faz o que ela faz de melhor.

A saída é gerada um token por vez. Para escrever a palavra 500 da resposta, o modelo precisa ter escrito as 499 anteriores e fazer mais uma passada completa por todos os seus bilhões de parâmetros. Quinhentos tokens de resposta são quinhentas passadas sequenciais.

Por isso a saída custa de duas a cinco vezes a entrada em todos os modelos, de todos os fornecedores do mundo. E por isso a instrução mais rentável que você pode colocar no seu sistema é "seja conciso".

A conta de uma conversa

Um assistente interno, pergunta típica com contexto de documentos recuperados:

ItemTokensCom gpub-fastCom gpub-plusCom gpub-max
Instrução do sistema400
Histórico da conversa1.200
Trechos de documento2.500
Pergunta do usuário80
Total de entrada4.180R$ 0,00205R$ 0,00288R$ 0,0748
Resposta gerada450R$ 0,00049R$ 0,00180R$ 0,0382
Custo da mensagemR$ 0,0025R$ 0,0047R$ 0,113

Traduzindo para escala de produto — 40 pessoas, 50 mensagens por dia cada, 22 dias úteis, num total de 44 mil mensagens no mês:

Quarenta e quatro vezes de diferença pelo mesmo produto. É aqui que a decisão de arquitetura vira decisão de negócio — e o assunto da parte 9 desta série.

A armadilha que mais estoura orçamento: o histórico

Esta é a parte que quase todo mundo descobre tarde. O modelo não lembra de nada. A cada mensagem, a sua aplicação reenvia a conversa inteira — porque é a única forma de o modelo saber do que se está falando.

Ou seja: na mensagem 20 de uma conversa, você está pagando pela mensagem 1 pela vigésima vez.

Mensagem da conversaTokens enviados nessa mensagemTotal acumulado pago
500500
2.5007.500
10ª5.00027.500
20ª10.000105.000
40ª20.000410.000

Repare no formato: dobrar o tamanho da conversa quadruplica o que você pagou nela. Uma conversa longa de suporte, dessas de 40 idas e vindas, custa 400 mil tokens de entrada — o equivalente a mais de cinquenta conversas curtas de cinco mensagens.

✅ As três defesas contra isso

Janela deslizante. Mande as últimas 8 a 10 mensagens, não as 40. Na maioria dos produtos ninguém percebe a diferença.

Resumo rolante. Quando a conversa passa de N mensagens, peça ao modelo mais barato um resumo de 200 tokens do que ficou para trás e substitua o histórico antigo por ele. Custa um centésimo do que economiza.

Corte o contexto recuperado. Se você anexa trechos de documento a cada pergunta (parte 4), mande 3 trechos bem escolhidos, não 15 por precaução. É o item que mais infla a entrada.

Janela de contexto: o que realmente cabe

Contexto é o teto de tokens de uma chamada — entrada mais saída. Os modelos do catálogo vão de 200 mil a 1 milhão de tokens, o que em papel é bastante coisa:

Mas duas ressalvas honestas. Primeira: caber não é entender. Todo modelo perde precisão no meio de contextos muito longos — a informação enterrada na página 400 é encontrada com menos confiabilidade que a da página 3. Segunda: contexto grande é caro por definição, porque contexto é entrada e entrada é cobrada. Enfiar 800 mil tokens numa pergunta simples é pagar R$ 14 por algo que sairia por centavos com busca bem feita.

Contexto largo é rede de segurança, não estratégia. A estratégia está na parte 4.

Como escolher entre os cinco

Se a sua tarefa é...UsePor quê
Classificar, extrair campo, etiquetar, moderargpub-fastResposta curta e objetiva; o modelo mais barato acerta igual e você processa volume alto por quase nada
Conversar, atender, resumir, redigirgpub-plusO melhor equilíbrio da tabela — é a escolha padrão para a maioria dos produtos
Alto volume de tarefa objetiva com resposta médiagpub-miniRápido, barato e suficiente quando a saída não é longa
Análise densa, código não trivial, documento complexogpub-baseSobe um degrau real de qualidade sem ir ao topo da tabela
Raciocínio longo, base de código inteira, o caso difícilgpub-maxMaior capacidade do catálogo — use como exceção, não como padrão
⚠️ Não deixe o modelo mais caro como padrão

É o erro de custo número um, e ele é silencioso: funciona, ninguém reclama, e a conta chega quarenta vezes maior no fim do mês.

O caminho certo é o contrário: comece pelo mais barato e suba só onde a qualidade não bastar. Na prática, 80% a 90% das chamadas de um produto real são tarefas simples que o modelo econômico resolve. A parte 9 mostra como rotear isso automaticamente.

Na prática: o código

A API é compatível com o padrão OpenAI, então qualquer biblioteca, framework ou ferramenta que você já usa funciona trocando duas linhas — a URL base e a chave.

curl https://gpubrasil.com.br/v1/chat/completions \
  -H "Authorization: Bearer gpub_live_suachaveaqui" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gpub-plus",
    "messages": [
      {"role": "system", "content": "Você é o assistente interno da empresa. Responda em português, de forma direta e curta."},
      {"role": "user", "content": "Resuma a política de reembolso em 3 tópicos."}
    ],
    "max_tokens": 500
  }'

Em Python, com a biblioteca oficial da OpenAI apontada para cá:

from openai import OpenAI

cliente = OpenAI(
    base_url="https://gpubrasil.com.br/v1",
    api_key="gpub_live_suachaveaqui",
)

fluxo = cliente.chat.completions.create(
    model="gpub-plus",
    messages=[
        {"role": "system", "content": "Responda em português, de forma direta e curta."},
        {"role": "user", "content": "Explique o que é um token, para um leigo."},
    ],
    max_tokens=400,
    stream=True,          # a resposta chega palavra a palavra
)

for pedaco in fluxo:
    conteudo = pedaco.choices[0].delta.content
    if conteudo:
        print(conteudo, end="", flush=True)

Sobre o stream=True

Não é enfeite: é a diferença entre um produto que parece rápido e um que parece travado. Sem fluxo contínuo, o usuário encara uma tela parada por 6 segundos até a resposta inteira chegar. Com fluxo, as primeiras palavras aparecem em menos de um segundo e a percepção de velocidade muda completamente — mesmo que o tempo total seja idêntico.

Custa o mesmo. Ligue sempre.

Duas defesas que valem no dia 1

E quando vale ter a GPU só sua?

Vale — e a resposta honesta é: mais tarde do que a maioria imagina. O ponto de virada depende do porte do modelo que você quer servir, e são dois cenários bem diferentes:

CenárioCusto da máquinaEquivale aVira melhor negócio acima de
Modelo pequeno numa placa de 24 GB, ligada 24/7R$ 2,78/h ≈ R$ 2.030/mêso modelo econômico da tabela~800 mil mensagens/mês
Modelo grande de ponta, em várias placas, 24/7a partir de ~R$ 15.700/mêso modelo intermediário da tabela~5 milhões de mensagens/mês

Ou seja: enquanto o seu produto não passa da casa do milhão de mensagens por mês, a placa dedicada é uma máquina cara ficando ociosa de madrugada.

Fora do volume, a GPU dedicada ainda ganha em duas situações:

  1. Modelo ajustado ao seu domínio — se você treinou um LoRA próprio, ele só roda na sua máquina.
  2. Exigência de isolamento — quando a política interna manda que o processamento aconteça numa instância dedicada só sua, com você controlando modelo, pesos e registros.

Fora desses casos, começar por token e migrar depois é quase sempre a decisão certa — e ela não te prende: como a API segue o padrão OpenAI, trocar para o seu próprio servidor mais tarde é mudar a URL base.

Teste antes de escrever qualquer código

O playground no painel roda os cinco modelos lado a lado, com uma amostra de teste de R$ 0,50 na primeira vez, e mostra o custo real de cada resposta. A chave de API é liberada após o primeiro depósito.

Ver a API por token →

Próxima parte: os olhos — fazer o assistente ler imagem e PDF.

Continue: parte 4: a memória · cortar a conta de tokens · escolher o modelo certo