InícioTemplates › LiteLLM Proxy
🧠 LLM Self-hosted

LiteLLM: um endereço para todos os modelos

1 endpoint OpenAI roteando 100+ provedores (cloud + local)

A partir de
carregando…
máquina mais barata que atende este template
Subir em 1 clique →

Este template não usa GPU: dá para subir também numa máquina de CPU dedicada, se você preferir mais núcleos e memória a placa de vídeo.

Memória de vídeo
não precisa de GPU
Instalação
~2 min
Acesso
porta 4000
Cobrança
por hora, em reais

O LiteLLM põe uma única API na frente de tudo: seu modelo próprio, o modelo do fornecedor A e o do fornecedor B. A aplicação chama um endereço só, e você troca o modelo por trás sem mexer no código.

LiteLLM Proxy unifica todos os provedores de LLM em uma API OpenAI-compatível: OpenAI, Anthropic, Bedrock, Gemini, Azure, vLLM/TGI local. Controle de custos, rate-limit, virtual keys, logs centralizados. Essencial para empresas.

Para que serve

Como subir

  1. Crie sua conta e adicione saldo em reais (Pix ou cartão, sem mensalidade).
  2. No console, escolha o template LiteLLM Proxy e a máquina — o próprio console esconde as que não atendem ao requisito.
  3. Em cerca de 2 minutos a instalação termina e o endereço de acesso aparece no painel, na porta 4000.

Terminou? Basta destruir a máquina: a cobrança para junto. Nada de contrato ou franquia mínima.

Perguntas frequentes

Precisa de GPU?

Não. O LiteLLM só roteia; escolha uma máquina de CPU e aponte para onde o modelo estiver rodando.

Funciona com modelo local?

Sim, é o caso mais comum: ele fica na frente do vLLM ou do Ollama da mesma rede.

Dá para limitar gasto por usuário?

Sim, com chaves virtuais que têm teto próprio e expiram.

LiteLLM Proxy rodando hoje
Você paga só as horas em que a máquina fica ligada.
Subir em 1 clique →

Templates relacionados

vLLM
API OpenAI-compatível pronta para Llama, Qwen, Mistral e mais
TGI (HuggingFace)
Text Generation Inference do HuggingFace — alternativa ao vLLM
Ollama
Rode DeepSeek, Qwen3, Llama e Mistral com 1 comando
GLM-5.2 (vLLM)
O open-source SOTA da Z.ai: 753B, 1M de contexto, licença MIT