LiteLLM: um endereço para todos os modelos
1 endpoint OpenAI roteando 100+ provedores (cloud + local)
Este template não usa GPU: dá para subir também numa máquina de CPU dedicada, se você preferir mais núcleos e memória a placa de vídeo.
- Memória de vídeo
- não precisa de GPU
- Instalação
- ~2 min
- Acesso
- porta 4000
- Cobrança
- por hora, em reais
O LiteLLM põe uma única API na frente de tudo: seu modelo próprio, o modelo do fornecedor A e o do fornecedor B. A aplicação chama um endereço só, e você troca o modelo por trás sem mexer no código.
LiteLLM Proxy unifica todos os provedores de LLM em uma API OpenAI-compatível: OpenAI, Anthropic, Bedrock, Gemini, Azure, vLLM/TGI local. Controle de custos, rate-limit, virtual keys, logs centralizados. Essencial para empresas.
Para que serve
- Trocar de modelo sem alterar a aplicação
- Teto de gasto e chave por equipe ou por cliente
- Registro central de todas as chamadas, para auditoria
- Queda de um modelo cai automaticamente para o outro
Como subir
- Crie sua conta e adicione saldo em reais (Pix ou cartão, sem mensalidade).
- No console, escolha o template LiteLLM Proxy e a máquina — o próprio console esconde as que não atendem ao requisito.
- Em cerca de 2 minutos a instalação termina e o endereço de acesso aparece no painel, na porta 4000.
Terminou? Basta destruir a máquina: a cobrança para junto. Nada de contrato ou franquia mínima.
Perguntas frequentes
Precisa de GPU?
Não. O LiteLLM só roteia; escolha uma máquina de CPU e aponte para onde o modelo estiver rodando.
Funciona com modelo local?
Sim, é o caso mais comum: ele fica na frente do vLLM ou do Ollama da mesma rede.
Dá para limitar gasto por usuário?
Sim, com chaves virtuais que têm teto próprio e expiram.