"IA na empresa" costuma virar reunião longa e projeto que não sai. Este artigo é o oposto: dez casos de uso concretos, com o código que os resolve e quanto cada um custa em reais por mês, calculado com os preços públicos da nossa API por token. Todos os números foram calculados com a tabela vigente em 15/08/2026 e você pode refazer cada conta.

⚡ A fórmula que gera todos os números

custo = (tokens_entrada ÷ 1.000.000 × preço_entrada) + (tokens_saída ÷ 1.000.000 × preço_saída)

Preços por milhão de tokens: gpub-fast R$ 0,49 / R$ 1,09 · gpub-mini R$ 0,59 / R$ 3,49 · gpub-plus R$ 0,69 / R$ 3,99 · gpub-base R$ 7,90 / R$ 17,90 · gpub-max R$ 17,90 / R$ 84,90. Regra de bolso: 1.000 tokens ≈ 750 palavras em português.

O resumo, antes do detalhe

#Caso de usoVolume mensalModeloCusto/mês
1Classificar e rotear tickets100.000 ticketsgpub-fastR$ 41,38
2Extrair campos de documento/PDF10.000 documentosgpub-miniR$ 28,17
3Atendimento com RAG50.000 perguntasgpub-plusR$ 217,80
4Resumir reuniões transcritas1.000 reuniõesgpub-fastR$ 6,53
5Traduzir catálogo de produtos20.000 descriçõesgpub-miniR$ 32,64
6Moderar conteúdo1.000.000 mensagensgpub-fastR$ 78,95
7Gerar descrição de produto5.000 produtosgpub-plusR$ 6,02
8Agente que lê a base de código200 execuçõesgpub-maxR$ 800,90
9Analisar contratos longos500 contratosgpub-baseR$ 175,90
10Qualificar leads no CRM30.000 leadsgpub-fastR$ 10,78

Somando tudo: R$ 1.399 por mês para dez automações rodando ao mesmo tempo. É menos que um estagiário — e nenhuma delas exige provisionar servidor.

1. Classificar e rotear tickets — R$ 0,00041 por ticket

Entrada de ~800 tokens (o ticket) e saída de ~20 (a categoria). O modelo mais barato resolve: classificação não pede raciocínio longo, pede consistência.

from openai import OpenAI
from concurrent.futures import ThreadPoolExecutor

cliente = OpenAI(api_key=CHAVE, base_url="https://gpubrasil.com.br/v1")

CATEGORIAS = ["cobranca", "acesso", "bug", "duvida_produto", "cancelamento"]

def classificar(ticket):
    r = cliente.chat.completions.create(
        model="gpub-fast",
        messages=[
            {"role": "system", "content":
             "Classifique o ticket em UMA categoria: " + ", ".join(CATEGORIAS) +
             ". Responda apenas a categoria, sem explicacao."},
            {"role": "user", "content": ticket},
        ],
        temperature=0,
        max_tokens=8,
    )
    return r.choices[0].message.content.strip(), r.usage.cost_brl

# 100 mil tickets em paralelo, com limite de concorrencia
with ThreadPoolExecutor(max_workers=16) as pool:
    resultados = list(pool.map(classificar, tickets))

print("Custo total: R$", round(sum(c for _, c in resultados), 2))

Conta: 80M tokens de entrada × R$ 0,49 = R$ 39,20 · 2M de saída × R$ 1,09 = R$ 2,18 → R$ 41,38.

2. Extrair campos de documento — R$ 0,0028 por documento

Nota fiscal, contrato, laudo, ficha cadastral. O truque é pedir JSON e só JSON, e validar no seu código.

import json

ESQUEMA = """Extraia e responda SOMENTE com JSON valido:
{"fornecedor": str, "cnpj": str, "numero": str, "data": "AAAA-MM-DD",
 "valor_total": number, "itens": [{"descricao": str, "quantidade": number, "valor": number}]}
Se um campo nao existir no documento, use null."""

def extrair(texto_do_documento):
    r = cliente.chat.completions.create(
        model="gpub-mini",
        messages=[
            {"role": "system", "content": ESQUEMA},
            {"role": "user", "content": texto_do_documento},
        ],
        temperature=0,
        max_tokens=800,
    )
    bruto = r.choices[0].message.content.strip()
    bruto = bruto.removeprefix("```json").removeprefix("```").removesuffix("```")
    return json.loads(bruto), r.usage.cost_brl

Para o PDF virar texto antes disso, os templates Marker e Surya OCR rodam numa GPU pequena e lidam bem com português e documento escaneado.

Conta: 30M de entrada × R$ 0,59 = R$ 17,70 · 3M de saída × R$ 3,49 = R$ 10,47 → R$ 28,17.

3. Atendimento com RAG — R$ 0,0044 por pergunta

O padrão que mais gera valor: busca vetorial na sua base + resposta com as fontes. Entrada de ~4.000 tokens (pergunta + trechos recuperados), saída de ~400.

def responder(pergunta, buscar_trechos):
    trechos = buscar_trechos(pergunta, k=6)          # Qdrant, pgvector, o que voce usar
    contexto = "\n\n".join(f"[{i+1}] {t}" for i, t in enumerate(trechos))
    r = cliente.chat.completions.create(
        model="gpub-plus",
        messages=[
            {"role": "system", "content":
             "Responda usando SOMENTE o contexto. Cite as fontes como [1], [2]. "
             "Se a resposta nao estiver no contexto, diga que nao encontrou."},
            {"role": "user", "content": f"Contexto:\n{contexto}\n\nPergunta: {pergunta}"},
        ],
        temperature=0.2,
        max_tokens=500,
    )
    return r.choices[0].message.content, r.usage.cost_brl

Para o banco vetorial, o template Qdrant em 1 clique sobe em minutos e roda até sem GPU. Se preferir uma interface pronta de "ChatGPT da empresa", o AnythingLLM cobre o caminho inteiro.

Conta: 200M de entrada × R$ 0,69 = R$ 138,00 · 20M de saída × R$ 3,99 = R$ 79,80 → R$ 217,80.

4. Resumir reuniões — R$ 0,0065 por reunião

Uma hora de reunião transcrita dá algo em torno de 12.000 tokens. Como o gpub-fast tem 1 milhão de tokens de contexto, a transcrição inteira entra numa chamada só.

PROMPT = """Resuma a reuniao em:
1) Decisoes tomadas
2) Pendencias, com responsavel e prazo quando houver
3) Riscos mencionados
Seja factual. Nao invente responsavel nem prazo."""

def resumir(transcricao):
    r = cliente.chat.completions.create(
        model="gpub-fast",
        messages=[{"role": "system", "content": PROMPT},
                  {"role": "user", "content": transcricao}],
        max_tokens=800,
    )
    return r.choices[0].message.content, r.usage.cost_brl

Para gerar a transcrição, o Whisper Server em 1 clique roda numa GPU pequena e transcreve português muito bem — e áudio processa muito mais rápido que tempo real, então o custo de GPU também é baixo.

Conta: 12M de entrada × R$ 0,49 = R$ 5,88 · 0,6M de saída × R$ 1,09 = R$ 0,65 → R$ 6,53.

5 a 7. Catálogo, moderação e conteúdo — os que rodam em volume

5. Traduzir e localizar catálogo (20.000 descrições) — R$ 32,64

400 tokens de entrada, 400 de saída, no gpub-mini. Localizar não é só traduzir: peça adaptação de unidade, moeda e tom no mesmo prompt.

6. Moderar conteúdo (1 milhão de mensagens) — R$ 78,95

150 tokens de entrada, 5 de saída, no gpub-fast. Sai a R$ 0,000079 por mensagem. Use temperature=0 e uma política escrita no system prompt, e mande para revisão humana só o que ficar acima do limiar de dúvida.

7. Gerar descrição de produto (5.000 produtos) — R$ 6,02

300 tokens de entrada (ficha técnica), 250 de saída, no gpub-plus. Combine com geração de imagem em GPU por hora e o catálogo inteiro se renova por menos de R$ 50.

8. Agente que lê a base de código — e a lição de custo mais importante

Aqui aparece o efeito que pega todo mundo de surpresa: quem manda na conta é o contexto, não a resposta. Um agente que lê 200 mil tokens de repositório e escreve 5 mil de patch, 200 vezes no mês:

ModeloEntrada (40M tokens)Saída (1M tokens)Total
gpub-maxR$ 716,00R$ 84,90R$ 800,90
gpub-plusR$ 27,60R$ 3,99R$ 31,59

25× de diferença na mesma tarefa. Isso não quer dizer "use sempre o barato": quer dizer que vale medir. Rode os dois em 20 casos reais, compare a taxa de acerto e decida com número. Muitas vezes o modelo grande vence em 10% dos casos difíceis — e a arquitetura certa é usar o barato por padrão e escalar para o caro só quando o barato admitir dúvida.

def resolver(tarefa):
    r = cliente.chat.completions.create(
        model="gpub-plus",
        messages=[{"role": "system", "content":
                   "Se nao tiver certeza suficiente, responda exatamente: ESCALAR"},
                  {"role": "user", "content": tarefa}],
        max_tokens=1500,
    )
    saida = r.choices[0].message.content
    if "ESCALAR" in saida:                       # so o dificil paga caro
        r = cliente.chat.completions.create(
            model="gpub-max",
            messages=[{"role": "user", "content": tarefa}],
            max_tokens=4000,                     # modelo de raciocinio precisa de folga
        )
        saida = r.choices[0].message.content
    return saida

9 e 10. Contratos e CRM

9. Analisar contratos longos (500 contratos) — R$ 175,90

40 mil tokens de entrada, 2 mil de saída, no gpub-base. Peça cláusulas de risco, prazos, multas e renovação automática — sempre com a instrução de citar o trecho que sustenta cada apontamento. É o que transforma a saída em algo que o jurídico consegue conferir.

10. Qualificar leads no CRM (30.000 leads) — R$ 10,78

600 tokens de entrada (formulário + histórico), 60 de saída, no gpub-fast. Classificação de intenção, porte e urgência, gravada de volta no CRM. Casa muito bem com automação visual: o template n8n em 1 clique conecta formulário, API e CRM sem escrever serviço nenhum.

💡 Quatro hábitos que cortam a conta pela metade

1. Corte o contexto. Mandar o documento inteiro quando três parágrafos bastam é o desperdício mais comum — e entrada é a maior parte da fatura em quase todo caso desta lista.
2. Limite a saída. max_tokens apertado onde a resposta é curta; folgado onde o modelo raciocina.
3. Use temperature=0 em tarefa objetiva. Menos variação, menos retrabalho, mais fácil de auditar.
4. Registre usage.cost_brl por tipo de tarefa. Sem isso você otimiza no escuro.

Quando parar de usar token e subir uma GPU

Existe um ponto em que a GPU dedicada fica mais barata que o token — e ele é calculável, não é opinião. Fizemos essa conta em detalhe, com os dois lados numerados, em Comparativo de preços de API de LLM em 2026. Adiantando o resumo: o volume precisa ser alto e constante; se a sua carga é em rajada, o token vence quase sempre.

Escolha um caso desta lista e rode hoje

Cobrança em reais, no mesmo saldo das suas GPUs, sem assinatura e sem mínimo de tokens.

Ver preços e documentação →

Perguntas frequentes

Quanto custa classificar tickets de suporte com IA?

Com entrada de cerca de 800 tokens por ticket e saída de 20 tokens, usando o modelo gpub-fast a R$ 0,49 por milhão de tokens de entrada e R$ 1,09 de saída, classificar 100 mil tickets por mês custa R$ 41,38, ou cerca de R$ 0,00041 por ticket.

Qual modelo usar para cada tipo de tarefa?

Para tarefas objetivas em volume, como classificar, extrair, moderar e rotear, os modelos econômicos gpub-fast e gpub-mini resolvem. Para conversa, código e RAG do dia a dia, gpub-plus tem a melhor relação qualidade e preço. Para raciocínio longo e contexto muito grande, gpub-max, sempre com teto de saída folgado. Vale testar dois modelos nos seus casos reais e decidir com medição.

Como reduzir o custo da API de LLM?

Quatro hábitos cortam a conta pela metade: enviar só o contexto necessário, já que entrada costuma ser a maior parte da fatura; limitar max_tokens onde a resposta é curta; usar temperature igual a zero em tarefa objetiva; e registrar o campo usage.cost_brl por tipo de tarefa para saber onde otimizar. Uma quinta técnica é escalar para o modelo caro só quando o barato admitir dúvida.

Leia também: Comparativo de preços de API de LLM em 2026 · Como funciona a nossa API por token · Qdrant para RAG em 1 clique