InícioTemplates › vLLM
🧠 LLM Self-hosted

vLLM: seu próprio servidor de LLM

API OpenAI-compatível pronta para Llama, Qwen, Mistral e mais

A partir de
carregando…
máquina mais barata que atende este template
Subir em 1 clique →
Memória de vídeo
12 GB
Instalação
~6 min
Acesso
porta 8000
Cobrança
por hora, em reais

O vLLM é o servidor de inferência mais usado para colocar um modelo aberto em produção: API no padrão OpenAI, lote contínuo e uso eficiente da memória de vídeo. Troque a URL da sua aplicação e ela passa a falar com o seu modelo.

vLLM é o servidor LLM mais rápido (PagedAttention). Inicia com Qwen2.5-3B-Instruct (multilíngue, ótimo PT-BR) — basta editar o compose para trocar por qualquer modelo do HuggingFace. Endpoint /v1/chat/completions plug-and-play com qualquer cliente OpenAI.

Para que serve

Como subir

  1. Crie sua conta e adicione saldo em reais (Pix ou cartão, sem mensalidade).
  2. No console, escolha o template vLLM e a máquina — o próprio console esconde as que não atendem ao requisito.
  3. Em cerca de 6 minutos a instalação termina e o endereço de acesso aparece no painel, na porta 8000.

Terminou? Basta destruir a máquina: a cobrança para junto. Nada de contrato ou franquia mínima.

Perguntas frequentes

Qual modelo devo escolher?

Modelos de 7 a 14 bilhões de parâmetros cabem em placas de 24 GB e já resolvem a maioria dos casos. Acima disso, olhe as máquinas de 80 GB ou mais.

A API é mesmo compatível?

Sim, os endpoints de chat e de completions seguem o padrão OpenAI, então bibliotecas existentes funcionam trocando a URL base.

Quando sai mais barato que pagar por token?

Quando o uso é constante. Uma máquina ligada 8 horas por dia com volume alto costuma sair bem abaixo do preço por token; para uso esporádico, a API por token é mais simples.

vLLM rodando hoje
Você paga só as horas em que a máquina fica ligada.
Subir em 1 clique →

Templates relacionados

TGI (HuggingFace)
Text Generation Inference do HuggingFace — alternativa ao vLLM
LiteLLM Proxy
1 endpoint OpenAI roteando 100+ provedores (cloud + local)
Ollama
Rode DeepSeek, Qwen3, Llama e Mistral com 1 comando
GLM-5.2 (vLLM)
O open-source SOTA da Z.ai: 753B, 1M de contexto, licença MIT