vLLM: seu próprio servidor de LLM
API OpenAI-compatível pronta para Llama, Qwen, Mistral e mais
- Memória de vídeo
- 12 GB
- Instalação
- ~6 min
- Acesso
- porta 8000
- Cobrança
- por hora, em reais
O vLLM é o servidor de inferência mais usado para colocar um modelo aberto em produção: API no padrão OpenAI, lote contínuo e uso eficiente da memória de vídeo. Troque a URL da sua aplicação e ela passa a falar com o seu modelo.
vLLM é o servidor LLM mais rápido (PagedAttention). Inicia com Qwen2.5-3B-Instruct (multilíngue, ótimo PT-BR) — basta editar o compose para trocar por qualquer modelo do HuggingFace. Endpoint /v1/chat/completions plug-and-play com qualquer cliente OpenAI.
Para que serve
- Trocar API paga por token por um modelo próprio de custo fixo
- Atender muitos usuários ao mesmo tempo com lote contínuo
- Manter prompts e respostas dentro da sua infraestrutura
- Testar vários modelos abertos sem mudar o código do cliente
Como subir
- Crie sua conta e adicione saldo em reais (Pix ou cartão, sem mensalidade).
- No console, escolha o template vLLM e a máquina — o próprio console esconde as que não atendem ao requisito.
- Em cerca de 6 minutos a instalação termina e o endereço de acesso aparece no painel, na porta 8000.
Terminou? Basta destruir a máquina: a cobrança para junto. Nada de contrato ou franquia mínima.
Perguntas frequentes
Qual modelo devo escolher?
Modelos de 7 a 14 bilhões de parâmetros cabem em placas de 24 GB e já resolvem a maioria dos casos. Acima disso, olhe as máquinas de 80 GB ou mais.
A API é mesmo compatível?
Sim, os endpoints de chat e de completions seguem o padrão OpenAI, então bibliotecas existentes funcionam trocando a URL base.
Quando sai mais barato que pagar por token?
Quando o uso é constante. Uma máquina ligada 8 horas por dia com volume alto costuma sair bem abaixo do preço por token; para uso esporádico, a API por token é mais simples.