Ollama com GPU de verdade
Rode DeepSeek, Qwen3, Llama e Mistral com 1 comando
- Memória de vídeo
- 8 GB
- Instalação
- ~5 min
- Acesso
- porta 11434
- Cobrança
- por hora, em reais
O Ollama é a forma mais rápida de sair do zero: um comando baixa o modelo e ele já está no ar com API compatível. Num notebook, um modelo médio arrasta; numa GPU alugada por hora, responde na hora.
Ollama é a forma mais simples de servir LLMs open-source: baixe e rode DeepSeek-R1, Qwen3, Llama 3.x, Mistral, GLM e centenas de modelos com 'ollama pull'. Expõe API compatível com OpenAI na porta 11434. Inicia com qwen3:8b.
Para que serve
- Testar vários modelos no mesmo dia sem configurar nada
- Prototipar aplicação com API compatível antes de escalar
- Trocar de modelo com um comando, mantendo o mesmo cliente
- Manter os dados do teste fora de serviços de terceiros
Como subir
- Crie sua conta e adicione saldo em reais (Pix ou cartão, sem mensalidade).
- No console, escolha o template Ollama e a máquina — o próprio console esconde as que não atendem ao requisito.
- Em cerca de 5 minutos a instalação termina e o endereço de acesso aparece no painel, na porta 11434.
Terminou? Basta destruir a máquina: a cobrança para junto. Nada de contrato ou franquia mínima.
Perguntas frequentes
Qual a diferença para o vLLM?
O Ollama é imbatível em facilidade e ótimo para um usuário por vez; o vLLM rende muito mais quando vários usuários chamam ao mesmo tempo.
Consigo rodar modelo de qual tamanho?
Depende da placa: 8 GB rodam modelos de 7 a 8 bilhões quantizados; 24 GB abrem espaço para 30 bilhões quantizados.
Ele expõe API?
Sim, com endpoints próprios e também no padrão OpenAI.