GLM-5.2 em máquina própria
O open-source SOTA da Z.ai: 753B, 1M de contexto, licença MIT
- Memória de vídeo
- 800 GB
- Instalação
- ~15 min
- Acesso
- porta 8000
- Cobrança
- por hora, em reais
O GLM-5.2 é um dos modelos abertos de contexto muito longo, e por isso exige máquina multi-GPU. Este template já sobe o vLLM com o particionamento entre placas configurado.
Sirva o GLM-5.2 (Z.ai) via vLLM com API OpenAI-compatível. Modelo MoE de 753B (~40B ativos), contexto de 1M, forte em agentes e código. ATENÇÃO: o modelo completo exige múltiplas GPUs H100/H200 (alta VRAM) ou variante quantizada — ajuste tensor-parallel e o modelo via variáveis de ambiente.
Para que serve
- Análise de documento muito longo em uma passada só
- Agente de código com contexto amplo do repositório
- Alternativa aberta a modelos de fronteira fechados
- Prompts e respostas sem passar por API de terceiro
Como subir
- Crie sua conta e adicione saldo em reais (Pix ou cartão, sem mensalidade).
- No console, escolha o template GLM-5.2 (vLLM) e a máquina — o próprio console esconde as que não atendem ao requisito.
- Em cerca de 15 minutos a instalação termina e o endereço de acesso aparece no painel, na porta 8000.
Terminou? Basta destruir a máquina: a cobrança para junto. Nada de contrato ou franquia mínima.
Perguntas frequentes
Quanta memória de vídeo preciso?
Cerca de 320 GB, ou seja, um bloco de várias placas de 80 a 141 GB. Confira a disponibilidade no console antes de reservar.
Quanto tempo leva para subir?
O download dos pesos é a parte demorada: conte alguns minutos até o servidor responder.
Vale a pena frente à API por token?
Só com uso pesado e contínuo. Para volume baixo, o custo da máquina multi-GPU não se paga.