InícioTemplates › Qwen3-235B-A22B
🧠 LLM Self-hosted

Qwen3-235B em bloco de GPUs

O flagship MoE da Qwen para raciocínio e código

A partir de
carregando…
máquina mais barata que atende este template
Subir em 1 clique →
Memória de vídeo
480 GB
Instalação
~15 min
Acesso
porta 8000
Cobrança
por hora, em reais

O Qwen3-235B é um modelo de mistura de especialistas: muitos parâmetros no total, poucos ativos por token. Isso dá qualidade de modelo grande com throughput melhor do que o tamanho sugere — desde que caiba na memória.

Qwen3-235B-A22B (MoE) servido via vLLM com API OpenAI-compatível — top em raciocínio e código entre os open-source. ATENÇÃO: exige múltiplas GPUs H100/H200 ou quantização. Para 1 GPU, use o template Qwen3 (8B).

Para que serve

Como subir

  1. Crie sua conta e adicione saldo em reais (Pix ou cartão, sem mensalidade).
  2. No console, escolha o template Qwen3-235B-A22B e a máquina — o próprio console esconde as que não atendem ao requisito.
  3. Em cerca de 15 minutos a instalação termina e o endereço de acesso aparece no painel, na porta 8000.

Terminou? Basta destruir a máquina: a cobrança para junto. Nada de contrato ou franquia mínima.

Perguntas frequentes

Quanta memória de vídeo?

Cerca de 480 GB. Na prática, um bloco de placas de 80 a 141 GB.

Mistura de especialistas ajuda no custo?

Sim: como poucos especialistas são ativados por token, a velocidade por requisição é melhor do que a de um modelo denso do mesmo tamanho.

Dá para rodar quantizado em menos placas?

Dá, ao custo de alguma qualidade. Use o console para ver quais blocos estão disponíveis no momento.

Qwen3-235B-A22B rodando hoje
Você paga só as horas em que a máquina fica ligada.
Subir em 1 clique →

Templates relacionados

vLLM
API OpenAI-compatível pronta para Llama, Qwen, Mistral e mais
TGI (HuggingFace)
Text Generation Inference do HuggingFace — alternativa ao vLLM
LiteLLM Proxy
1 endpoint OpenAI roteando 100+ provedores (cloud + local)
Ollama
Rode DeepSeek, Qwen3, Llama e Mistral com 1 comando