InícioTemplates › TGI (HuggingFace)
🧠 LLM Self-hosted

TGI: inferência com quantização pronta

Text Generation Inference do HuggingFace — alternativa ao vLLM

A partir de
carregando…
máquina mais barata que atende este template
Subir em 1 clique →
Memória de vídeo
12 GB
Instalação
~6 min
Acesso
porta 8080
Cobrança
por hora, em reais

O TGI é o servidor de inferência da Hugging Face, com streaming de tokens e quantização de fábrica. É a escolha natural de quem já vive dentro do ecossistema deles e quer o mesmo comportamento em produção.

TGI é o servidor de produção do HuggingFace para LLMs. Excelente suporte a modelos quantizados (GPTQ, AWQ, EETQ), streaming nativo, métricas Prometheus. Roda Qwen2.5-3B por padrão.

Para que serve

Como subir

  1. Crie sua conta e adicione saldo em reais (Pix ou cartão, sem mensalidade).
  2. No console, escolha o template TGI (HuggingFace) e a máquina — o próprio console esconde as que não atendem ao requisito.
  3. Em cerca de 6 minutos a instalação termina e o endereço de acesso aparece no painel, na porta 8080.

Terminou? Basta destruir a máquina: a cobrança para junto. Nada de contrato ou franquia mínima.

Perguntas frequentes

TGI ou vLLM?

O vLLM costuma render mais em lote e tem API compatível com o padrão OpenAI; o TGI se integra melhor ao ecossistema Hugging Face e traz quantização pronta.

Preciso de token do Hub?

Só para modelos com acesso restrito. Modelos abertos baixam direto.

Qual GPU escolher?

12 GB rodam modelos quantizados de porte médio. Para modelos maiores sem quantização, vá para 40 GB ou mais.

TGI (HuggingFace) rodando hoje
Você paga só as horas em que a máquina fica ligada.
Subir em 1 clique →

Templates relacionados

vLLM
API OpenAI-compatível pronta para Llama, Qwen, Mistral e mais
LiteLLM Proxy
1 endpoint OpenAI roteando 100+ provedores (cloud + local)
Ollama
Rode DeepSeek, Qwen3, Llama e Mistral com 1 comando
GLM-5.2 (vLLM)
O open-source SOTA da Z.ai: 753B, 1M de contexto, licença MIT