Em 3 de agosto de 2026, o time Qwen, da Alibaba, lançou o Qwen3.8-Max: um modelo de 2,4 trilhões de parâmetros em arquitetura Mixture-of-Experts, com cerca de 95 bilhões de parâmetros ativos por token, janela de 1 milhão de tokens e entrada nativa de texto, imagem e vídeo. Mais importante que o tamanho: é a primeira vez que a linha Max será aberta — os pesos foram anunciados para publicação, junto com um irmão menor, o Qwen3.8-27B.
O Qwen3.8-Max lidera benchmarks de uso autônomo de computador: 86,1 no OSWorld-Verified, à frente do GPT-5.6 Sol Max (83,2) e do Gemini 3.1 Pro (76,2), e 93,0 no PaperBench. Para quem trabalha no Brasil, o recado prático não é "o modelo gigante chegou" — é que o irmão de 27B da mesma geração já está disponível, cabe numa GPU só e custa centavos por milhão de tokens.
O que o Qwen3.8-Max realmente entrega
Os números que importam não são os de conversa fiada, e sim os de trabalho longo e autônomo — a categoria em que a maioria dos modelos ainda tropeça depois de dez ou quinze passos:
| Benchmark | Qwen3.8-Max | Comparação |
|---|---|---|
| OSWorld-Verified (uso de computador) | 86,1 | Claude Fable 5: 85,0 · GPT-5.6 Sol Max: 83,2 · Gemini 3.1 Pro: 76,2 |
| PaperBench (pesquisa longa) | 93,0 | Melhor resultado público da categoria |
| Parâmetros | 2,4 T (MoE) | ~95 B ativos por token |
| Contexto | 1.000.000 tokens | Entrada nativa de texto, imagem e vídeo |
Em codificação agêntica, ele encosta no topo (Terminal Bench 2.1 e SWE-Bench Pro), mas não vence tudo: o Claude Fable 5 continua à frente em SWE-Pro e o GPT-5.6 Sol lidera o Agents' Last Exam. A leitura honesta é que o pódio virou um empate técnico entre modelos fechados e abertos — e essa é a notícia de verdade.
Por que o 27B interessa mais que o 2,4T
Um modelo de 2,4 trilhões de parâmetros, mesmo aberto, não é algo que você sobe numa GPU. Em MoE, todos os pesos precisam estar carregados em memória, ainda que só uma fração seja ativada por token: falamos de múltiplos nós de GPU e uma engenharia de servir que raríssima empresa brasileira precisa ter.
O Qwen3.8-27B, lançado ao lado dele, é a peça que muda o dia a dia. Mesma geração, mesmo treino base, tamanho que cabe em uma GPU única. Na prática você tem duas formas de usá-lo hoje aqui:
1. Pela API por token, sem provisionar nada
Ele está no nosso catálogo de inferência como gpub-plus, a R$ 0,69 por milhão de tokens de entrada e R$ 3,99 por milhão de saída, com 250 mil tokens de contexto. A API é compatível com a da OpenAI, então basta trocar a base_url:
from openai import OpenAI
cliente = OpenAI(
api_key="gpub_live_suachaveaqui",
base_url="https://gpubrasil.com.br/v1",
)
r = cliente.chat.completions.create(
model="gpub-plus",
messages=[{"role": "user", "content": "Resuma este contrato em 5 tópicos."}],
)
print(r.choices[0].message.content)
print("Custo em R$:", r.usage.cost_brl)
Cada resposta traz usage.cost_brl — o custo em reais daquela chamada, calculado pelo servidor. Não é estimativa: é o valor debitado.
2. Numa GPU dedicada, se você precisa de controle ou fine-tuning
Um 27B quantizado em FP8 ocupa por volta de 27 GB de pesos, mais o cache de contexto. Isso significa:
| GPU | VRAM | Preço/hora | Serve para |
|---|---|---|---|
| RTX 5090 | 32 GB | R$ 4,77 | FP8 com contexto curto, protótipo |
| RTX 6000 Ada | 48 GB | R$ 6,01 | FP8 confortável, contexto médio |
| RTX PRO 6000 | 96 GB | R$ 10,26 | BF16 ou contexto muito longo |
| H100 | 80 GB | R$ 17,89 | Throughput alto, lote grande |
Preços de catálogo verificados em 15/08/2026, por hora, em reais. A disponibilidade e o valor variam em tempo real — o console mostra o preço vigente antes de você criar a máquina.
Para subir, o caminho curto é o template de vLLM em 1 clique: você escolhe a GPU, marca o template e em poucos minutos tem um endpoint compatível com OpenAI rodando dentro da sua instância. Detalhamos o passo a passo em vLLM self-hosted em 1 clique.
Três casos de uso que ficaram viáveis esta semana
Agente que opera sistemas legados pela interface
É exatamente o que o OSWorld mede: abrir uma tela, ler o que está nela, clicar, digitar, conferir. Muita empresa brasileira tem um ERP ou um portal de prefeitura sem API — e paga gente para digitar. Com um modelo forte em uso de computador, dá para automatizar o preenchimento e deixar a pessoa só na conferência. Comece pelo caminho barato: gpub-plus na API por token para o raciocínio, e só migre para GPU dedicada se o volume justificar.
Leitura de vídeo e imagem no mesmo pedido
Entrada nativa de vídeo abre inspeção visual sem pipeline separado de visão computacional: uma câmera de linha de produção, um vídeo de vistoria de veículo, uma gravação de atendimento. Para volume constante disso, a conta fecha melhor numa GPU dedicada com o modelo aberto — o vídeo consome muito token de entrada.
Pesquisa longa e relatório com fonte
PaperBench mede justamente isso: ler muito, sintetizar, não inventar. Com 1 milhão de tokens de contexto, cabe uma base inteira de documentos numa chamada só. Se o seu material é sensível, esse é o caso clássico em que a instância dedicada vence: os pesos rodam dentro de uma máquina que é só sua, e você decide o que fica em log, por quanto tempo e quem acessa.
Modelo de topo do ranking raramente é o modelo certo para a sua tarefa. Classificar ticket, extrair campo de nota fiscal e responder FAQ não precisam de 2,4 trilhões de parâmetros — precisam de latência baixa e custo por chamada perto de zero. Escreva a avaliação da sua tarefa primeiro, depois escolha. Escrevemos sobre isso em ‘Best fit wins’.
O que isso significa para o mercado
Três movimentos ficaram evidentes com este lançamento:
- Abrir virou estratégia de topo, não de segunda linha. Até 2025, os pesos abertos vinham dos modelos médios. Agora vêm da linha principal.
- O gargalo saiu do modelo e foi para a infraestrutura. Qualquer um baixa os pesos; poucos conseguem servir 2,4 T de parâmetros com latência aceitável.
- O par grande + pequeno virou padrão. O gigante define o teto de qualidade; o irmão pequeno é o que roda em produção.
Teste o Qwen 3.8 27B agora, sem provisionar nada
Ele está na nossa API por token como gpub-plus, cobrado em reais no mesmo saldo das suas GPUs. Ou suba uma GPU dedicada e rode os pesos você mesmo.
Perguntas frequentes
O que é o Qwen3.8-Max?
É o modelo mais capaz da linha Qwen, lançado pela Alibaba em 3 de agosto de 2026. Tem 2,4 trilhões de parâmetros em arquitetura Mixture-of-Experts, cerca de 95 bilhões ativos por token, janela de 1 milhão de tokens e entrada nativa de texto, imagem e vídeo. É a primeira vez que a linha Max ganha pesos abertos, publicados junto com um modelo menor, o Qwen3.8-27B.
Dá para rodar o Qwen3.8-Max numa GPU só?
Não. Em Mixture-of-Experts todos os pesos precisam estar carregados em memória, mesmo com só uma fração ativa por token, o que exige vários nós de GPU. O caminho prático para a maioria das empresas é usar o modelo menor da mesma geração, o Qwen 3.8 27B, que cabe em uma única GPU de 45 a 48 GB quantizado em FP8.
Quanto custa usar o Qwen 3.8 27B no GPUBrasil?
Ele está no catálogo da API por token como gpub-plus, a R$ 0,69 por milhão de tokens de entrada e R$ 3,99 por milhão de tokens de saída, com 250 mil tokens de contexto, cobrado em reais no mesmo saldo das instâncias de GPU. Também dá para rodá-lo você mesmo numa GPU dedicada: uma RTX 6000 Ada de 48 GB sai por R$ 6,01 por hora.
Leia também: Comparativo de preços de API de LLM em 2026 · GLM-5.3 e o topo dos modelos abertos de código · vLLM self-hosted em 1 clique