InícioTemplates › Ollama
🧠 LLM Self-hosted

Ollama com GPU de verdade

Rode DeepSeek, Qwen3, Llama e Mistral com 1 comando

A partir de
carregando…
máquina mais barata que atende este template
Subir em 1 clique →
Memória de vídeo
8 GB
Instalação
~5 min
Acesso
porta 11434
Cobrança
por hora, em reais

O Ollama é a forma mais rápida de sair do zero: um comando baixa o modelo e ele já está no ar com API compatível. Num notebook, um modelo médio arrasta; numa GPU alugada por hora, responde na hora.

Ollama é a forma mais simples de servir LLMs open-source: baixe e rode DeepSeek-R1, Qwen3, Llama 3.x, Mistral, GLM e centenas de modelos com 'ollama pull'. Expõe API compatível com OpenAI na porta 11434. Inicia com qwen3:8b.

Para que serve

Como subir

  1. Crie sua conta e adicione saldo em reais (Pix ou cartão, sem mensalidade).
  2. No console, escolha o template Ollama e a máquina — o próprio console esconde as que não atendem ao requisito.
  3. Em cerca de 5 minutos a instalação termina e o endereço de acesso aparece no painel, na porta 11434.

Terminou? Basta destruir a máquina: a cobrança para junto. Nada de contrato ou franquia mínima.

Perguntas frequentes

Qual a diferença para o vLLM?

O Ollama é imbatível em facilidade e ótimo para um usuário por vez; o vLLM rende muito mais quando vários usuários chamam ao mesmo tempo.

Consigo rodar modelo de qual tamanho?

Depende da placa: 8 GB rodam modelos de 7 a 8 bilhões quantizados; 24 GB abrem espaço para 30 bilhões quantizados.

Ele expõe API?

Sim, com endpoints próprios e também no padrão OpenAI.

Ollama rodando hoje
Você paga só as horas em que a máquina fica ligada.
Subir em 1 clique →

Templates relacionados

vLLM
API OpenAI-compatível pronta para Llama, Qwen, Mistral e mais
TGI (HuggingFace)
Text Generation Inference do HuggingFace — alternativa ao vLLM
LiteLLM Proxy
1 endpoint OpenAI roteando 100+ provedores (cloud + local)
GLM-5.2 (vLLM)
O open-source SOTA da Z.ai: 753B, 1M de contexto, licença MIT