InícioTemplates › DeepSeek-R1-Distill
🧠 LLM Self-hosted

DeepSeek-R1 Distill: raciocínio sem máquina gigante

Raciocínio forte do DeepSeek-R1 que cabe em 1 GPU

A partir de
carregando…
máquina mais barata que atende este template
Subir em 1 clique →
Memória de vídeo
20 GB
Instalação
~6 min
Acesso
porta 8000
Cobrança
por hora, em reais

As versões destiladas do R1 trazem a cadeia de raciocínio para um tamanho que cabe em placa comum. É o melhor ponto de partida para quem quer testar raciocínio passo a passo sem alugar um bloco de oito GPUs.

Versão destilada do DeepSeek-R1 (default: Llama-8B) — herda o raciocínio passo-a-passo do R1 num modelo pequeno que roda numa RTX 4090. Servido via vLLM com API OpenAI-compatível. Troque por distill 14B/32B (mais VRAM) editando o modelo.

Para que serve

Como subir

  1. Crie sua conta e adicione saldo em reais (Pix ou cartão, sem mensalidade).
  2. No console, escolha o template DeepSeek-R1-Distill e a máquina — o próprio console esconde as que não atendem ao requisito.
  3. Em cerca de 6 minutos a instalação termina e o endereço de acesso aparece no painel, na porta 8000.

Terminou? Basta destruir a máquina: a cobrança para junto. Nada de contrato ou franquia mínima.

Perguntas frequentes

Qual placa usar?

A partir de 20 GB de memória de vídeo. Uma placa de 24 GB atende com folga.

A diferença para o R1 completo é grande?

O completo raciocina melhor em problema difícil, mas exige centenas de GB. O destilado entrega boa parte do resultado a uma fração do custo.

Ele mostra o raciocínio?

Sim, o texto de raciocínio vem separado da resposta final e você decide se exibe.

DeepSeek-R1-Distill rodando hoje
Você paga só as horas em que a máquina fica ligada.
Subir em 1 clique →

Templates relacionados

vLLM
API OpenAI-compatível pronta para Llama, Qwen, Mistral e mais
TGI (HuggingFace)
Text Generation Inference do HuggingFace — alternativa ao vLLM
LiteLLM Proxy
1 endpoint OpenAI roteando 100+ provedores (cloud + local)
Ollama
Rode DeepSeek, Qwen3, Llama e Mistral com 1 comando