Até agora, quem queria rodar um modelo de linguagem aqui tinha um caminho: subir uma GPU e servir o modelo. É um caminho excelente — e é excessivo quando você só quer classificar mil tickets por dia. Por isso lançamos a nossa API de LLM por token: modelos de pesos abertos, cobrados em reais, compatíveis com a API da OpenAI, sem assinatura e debitados do mesmo saldo que já paga as suas instâncias de GPU.
URL base https://gpubrasil.com.br/v1. Autenticação com a mesma API key gpub_live_ que você já usa para provisionar GPU. Cinco modelos, de R$ 0,49 por milhão de tokens de entrada até a linha de raciocínio longo com 1 milhão de tokens de contexto. Toda resposta traz usage.cost_brl — o custo em reais daquela chamada. Sem mensalidade, sem franquia, sem mínimo de compra de tokens.
Por que criamos isso
Três reclamações apareciam sempre nas conversas com clientes:
- "Pago máquina parada." Uso intermitente com GPU dedicada significa hora comprada e não usada.
- "A fatura vem em dólar." Além do câmbio, compra internacional no cartão leva IOF de 3,5%. Você fecha o orçamento com um número e paga outro.
- "Não sei quanto custou aquela chamada." Painel de terceiro atualiza a cada horas, quando atualiza.
A API por token responde às três: você paga o que consumiu, em reais, e cada resposta já vem com o custo dentro.
O catálogo e os preços
| Identificador | Modelo | Contexto | Entrada (R$/1M) | Saída (R$/1M) |
|---|---|---|---|---|
gpub-fast | DeepSeek V4 Flash | 1.000.000 | R$ 0,49 | R$ 1,09 |
gpub-mini | Qwen 3.6 35B | 200.000 | R$ 0,59 | R$ 3,49 |
gpub-plus | Qwen 3.8 27B | 250.000 | R$ 0,69 | R$ 3,99 |
gpub-base | GLM 5.2 | 200.000 | R$ 7,90 | R$ 17,90 |
gpub-max | Kimi K3 | 1.000.000 | R$ 17,90 | R$ 84,90 |
Valores vigentes em 15/08/2026. A tabela ao vivo, que é a mesma fonte usada para cobrar, fica em gpubrasil.com.br/br/llm-api.html — consulte lá antes de fechar um orçamento.
Os identificadores são estáveis: quando o modelo por trás de um deles for atualizado para uma geração melhor, o seu código continua funcionando sem alteração. É de propósito — a última coisa que você precisa é reescrever integração porque um fornecedor renomeou um modelo.
Trocar de provedor é uma linha
Se o seu código já usa o SDK da OpenAI, a migração é literalmente a base_url:
from openai import OpenAI
cliente = OpenAI(
api_key="gpub_live_suachaveaqui",
base_url="https://gpubrasil.com.br/v1", # unica mudanca
)
r = cliente.chat.completions.create(
model="gpub-plus",
messages=[
{"role": "system", "content": "Responda em portugues do Brasil, direto ao ponto."},
{"role": "user", "content": "Explique o que e um token de LLM em duas frases."},
],
)
print(r.choices[0].message.content)
print("Custo desta chamada: R$", r.usage.cost_brl)
Em Node, o mesmo:
import OpenAI from "openai";
const cliente = new OpenAI({
apiKey: process.env.GPUB_API_KEY,
baseURL: "https://gpubrasil.com.br/v1",
});
const r = await cliente.chat.completions.create({
model: "gpub-fast",
messages: [{ role: "user", content: "Classifique este ticket: 'nao consigo logar'." }],
max_tokens: 16,
});
console.log(r.choices[0].message.content, "| R$", r.usage.cost_brl);
Em fluxo contínuo (streaming), peça o bloco de uso no último evento:
fluxo = cliente.chat.completions.create(
model="gpub-plus",
messages=[{"role": "user", "content": "Escreva um resumo executivo."}],
stream=True,
stream_options={"include_usage": True},
)
for parte in fluxo:
if parte.choices and parte.choices[0].delta.content:
print(parte.choices[0].delta.content, end="")
if parte.usage: # ultimo evento: uso e custo
print("\nCusto em R$:", parte.usage.cost_brl)
Como começar
- Crie a conta e faça o primeiro depósito. O acesso programático é liberado depois do primeiro depósito confirmado — antes disso, você testa os modelos pelo playground dentro do painel.
- Gere a API key na seção API Keys do painel. A chave em claro aparece uma única vez: guarde como senha.
- Troque a
base_urle rode. É isso.
No playground do painel, quando a sua pergunta depende de informação de agora — cotação, preço de cripto, notícia de mercado — o dado é buscado antes de a pergunta chegar ao modelo, e a resposta cita o valor e o horário da consulta. Nesses casos há uma taxa de acesso de R$ 0,05 por mensagem, somada ao custo dos tokens; conversa que não depende de dado atual não consulta nada e não paga taxa. Na API, o controle é seu: as chamadas para /v1/chat/completions não consultam a internet — você monta o contexto que quiser, ou declara uma ferramenta de busca em tools e executa você mesmo.
Três detalhes que evitam surpresa
Ferramentas não funcionam igual em todo modelo
Testamos e documentamos: gpub-max e gpub-plus pedem a ferramenta e usam o resultado corretamente. O gpub-fast pede, mas nem sempre aproveita bem o retorno. O gpub-mini não suporta ferramentas — ignora o pedido mesmo quando obrigado. Para agente com ferramentas, use gpub-max ou gpub-plus.
Modelo que raciocina precisa de teto de saída folgado
gpub-max e gpub-plus gastam tokens "pensando" antes de responder. Com max_tokens apertado, o raciocínio pode consumir a cota inteira e a resposta voltar vazia — e os tokens gastos são cobrados, porque foram gerados. Com gpub-max, use pelo menos 800 tokens de saída.
Erros seguem o padrão que você já conhece
| Código | Significado | O que fazer |
|---|---|---|
| 402 | Saldo insuficiente | Depositar e repetir a chamada |
| 403 | API ainda não liberada | Fazer o primeiro depósito; usar o playground enquanto isso |
| 429 | Limite de requisições | Esperar e repetir com recuo exponencial |
| 503 | Indisponível no momento | Repetir; considerar um modelo alternativo no seu código |
O envelope de erro é o mesmo formato da OpenAI: {"error":{"message","type","param","code"}}. Bibliotecas de retry que você já usa funcionam sem adaptação.
Um saldo só, duas formas de rodar IA
Essa é a parte que consideramos a mais útil do lançamento. O mesmo saldo em reais paga:
- Instâncias de GPU por hora — para fine-tuning, modelo próprio, imagem, vídeo, treino, ou volume alto e constante.
- Chamadas de API por token — para uso intermitente, protótipo, pico curto e integração rápida.
Na prática, a maioria dos projetos usa os dois: começa na API para validar em dias, e migra para GPU dedicada a parte que virou volume. A conta de quando migrar está em Comparativo de preços de API de LLM em 2026, e uma lista de casos prontos com código está em 10 casos de uso com código e custo real.
Uma última coisa, porque perguntam sempre: não usamos os seus prompts nem as respostas para treinar modelos. Se o seu requisito é controle total sobre pesos, logs e retenção, o caminho é a GPU dedicada — lá o modelo roda dentro de uma instância que é só sua.
Comece com uma chamada de centavos
Sem assinatura, sem mínimo de tokens, cobrado em reais no mesmo saldo das suas GPUs.
Ver preços e documentação →Perguntas frequentes
Como funciona a API de LLM por token do GPUBrasil?
A URL base é https://gpubrasil.com.br/v1 e os endpoints seguem o formato da API da OpenAI, incluindo respostas em fluxo contínuo. A autenticação usa a mesma API key gpub_live_ que provisiona GPUs, no header Authorization. Toda resposta traz usage.cost_brl, o custo em reais daquela chamada, e o consumo é debitado do mesmo saldo das instâncias de GPU.
Quais modelos estão disponíveis e quanto custam?
São cinco, com preço por milhão de tokens de entrada e de saída: gpub-fast a R$ 0,49 e R$ 1,09, gpub-mini a R$ 0,59 e R$ 3,49, gpub-plus a R$ 0,69 e R$ 3,99, gpub-base a R$ 7,90 e R$ 17,90, e gpub-max a R$ 17,90 e R$ 84,90. Os valores vigentes ficam na página de preços, que é carregada da mesma fonte usada para cobrar.
Preciso assinar um plano ou comprar um pacote de tokens?
Não. Não há assinatura, mensalidade, franquia nem mínimo de compra de tokens: a cobrança é proporcional ao que a chamada consumiu. Os únicos mínimos são os de depósito, que já valem para as GPUs, sendo R$ 100 no primeiro depósito, com bônus de R$ 12, ou R$ 25 a partir de R$ 300, e R$ 5 nas recargas seguintes.
Leia também: 10 casos de uso com código e custo real · Comparativo de preços de API de LLM em 2026 · LiteLLM: um proxy para vários modelos