Em 3 de agosto de 2026, o time Qwen, da Alibaba, lançou o Qwen3.8-Max: um modelo de 2,4 trilhões de parâmetros em arquitetura Mixture-of-Experts, com cerca de 95 bilhões de parâmetros ativos por token, janela de 1 milhão de tokens e entrada nativa de texto, imagem e vídeo. Mais importante que o tamanho: é a primeira vez que a linha Max será aberta — os pesos foram anunciados para publicação, junto com um irmão menor, o Qwen3.8-27B.

⚡ Resumo

O Qwen3.8-Max lidera benchmarks de uso autônomo de computador: 86,1 no OSWorld-Verified, à frente do GPT-5.6 Sol Max (83,2) e do Gemini 3.1 Pro (76,2), e 93,0 no PaperBench. Para quem trabalha no Brasil, o recado prático não é "o modelo gigante chegou" — é que o irmão de 27B da mesma geração já está disponível, cabe numa GPU só e custa centavos por milhão de tokens.

O que o Qwen3.8-Max realmente entrega

Os números que importam não são os de conversa fiada, e sim os de trabalho longo e autônomo — a categoria em que a maioria dos modelos ainda tropeça depois de dez ou quinze passos:

BenchmarkQwen3.8-MaxComparação
OSWorld-Verified (uso de computador)86,1Claude Fable 5: 85,0 · GPT-5.6 Sol Max: 83,2 · Gemini 3.1 Pro: 76,2
PaperBench (pesquisa longa)93,0Melhor resultado público da categoria
Parâmetros2,4 T (MoE)~95 B ativos por token
Contexto1.000.000 tokensEntrada nativa de texto, imagem e vídeo

Em codificação agêntica, ele encosta no topo (Terminal Bench 2.1 e SWE-Bench Pro), mas não vence tudo: o Claude Fable 5 continua à frente em SWE-Pro e o GPT-5.6 Sol lidera o Agents' Last Exam. A leitura honesta é que o pódio virou um empate técnico entre modelos fechados e abertos — e essa é a notícia de verdade.

Por que o 27B interessa mais que o 2,4T

Um modelo de 2,4 trilhões de parâmetros, mesmo aberto, não é algo que você sobe numa GPU. Em MoE, todos os pesos precisam estar carregados em memória, ainda que só uma fração seja ativada por token: falamos de múltiplos nós de GPU e uma engenharia de servir que raríssima empresa brasileira precisa ter.

O Qwen3.8-27B, lançado ao lado dele, é a peça que muda o dia a dia. Mesma geração, mesmo treino base, tamanho que cabe em uma GPU única. Na prática você tem duas formas de usá-lo hoje aqui:

1. Pela API por token, sem provisionar nada

Ele está no nosso catálogo de inferência como gpub-plus, a R$ 0,69 por milhão de tokens de entrada e R$ 3,99 por milhão de saída, com 250 mil tokens de contexto. A API é compatível com a da OpenAI, então basta trocar a base_url:

from openai import OpenAI

cliente = OpenAI(
    api_key="gpub_live_suachaveaqui",
    base_url="https://gpubrasil.com.br/v1",
)

r = cliente.chat.completions.create(
    model="gpub-plus",
    messages=[{"role": "user", "content": "Resuma este contrato em 5 tópicos."}],
)
print(r.choices[0].message.content)
print("Custo em R$:", r.usage.cost_brl)

Cada resposta traz usage.cost_brl — o custo em reais daquela chamada, calculado pelo servidor. Não é estimativa: é o valor debitado.

2. Numa GPU dedicada, se você precisa de controle ou fine-tuning

Um 27B quantizado em FP8 ocupa por volta de 27 GB de pesos, mais o cache de contexto. Isso significa:

GPUVRAMPreço/horaServe para
RTX 509032 GBR$ 4,77FP8 com contexto curto, protótipo
RTX 6000 Ada48 GBR$ 6,01FP8 confortável, contexto médio
RTX PRO 600096 GBR$ 10,26BF16 ou contexto muito longo
H10080 GBR$ 17,89Throughput alto, lote grande

Preços de catálogo verificados em 15/08/2026, por hora, em reais. A disponibilidade e o valor variam em tempo real — o console mostra o preço vigente antes de você criar a máquina.

Para subir, o caminho curto é o template de vLLM em 1 clique: você escolhe a GPU, marca o template e em poucos minutos tem um endpoint compatível com OpenAI rodando dentro da sua instância. Detalhamos o passo a passo em vLLM self-hosted em 1 clique.

Três casos de uso que ficaram viáveis esta semana

Agente que opera sistemas legados pela interface

É exatamente o que o OSWorld mede: abrir uma tela, ler o que está nela, clicar, digitar, conferir. Muita empresa brasileira tem um ERP ou um portal de prefeitura sem API — e paga gente para digitar. Com um modelo forte em uso de computador, dá para automatizar o preenchimento e deixar a pessoa só na conferência. Comece pelo caminho barato: gpub-plus na API por token para o raciocínio, e só migre para GPU dedicada se o volume justificar.

Leitura de vídeo e imagem no mesmo pedido

Entrada nativa de vídeo abre inspeção visual sem pipeline separado de visão computacional: uma câmera de linha de produção, um vídeo de vistoria de veículo, uma gravação de atendimento. Para volume constante disso, a conta fecha melhor numa GPU dedicada com o modelo aberto — o vídeo consome muito token de entrada.

Pesquisa longa e relatório com fonte

PaperBench mede justamente isso: ler muito, sintetizar, não inventar. Com 1 milhão de tokens de contexto, cabe uma base inteira de documentos numa chamada só. Se o seu material é sensível, esse é o caso clássico em que a instância dedicada vence: os pesos rodam dentro de uma máquina que é só sua, e você decide o que fica em log, por quanto tempo e quem acessa.

💡 A regra que continua valendo

Modelo de topo do ranking raramente é o modelo certo para a sua tarefa. Classificar ticket, extrair campo de nota fiscal e responder FAQ não precisam de 2,4 trilhões de parâmetros — precisam de latência baixa e custo por chamada perto de zero. Escreva a avaliação da sua tarefa primeiro, depois escolha. Escrevemos sobre isso em ‘Best fit wins’.

O que isso significa para o mercado

Três movimentos ficaram evidentes com este lançamento:

  1. Abrir virou estratégia de topo, não de segunda linha. Até 2025, os pesos abertos vinham dos modelos médios. Agora vêm da linha principal.
  2. O gargalo saiu do modelo e foi para a infraestrutura. Qualquer um baixa os pesos; poucos conseguem servir 2,4 T de parâmetros com latência aceitável.
  3. O par grande + pequeno virou padrão. O gigante define o teto de qualidade; o irmão pequeno é o que roda em produção.

Teste o Qwen 3.8 27B agora, sem provisionar nada

Ele está na nossa API por token como gpub-plus, cobrado em reais no mesmo saldo das suas GPUs. Ou suba uma GPU dedicada e rode os pesos você mesmo.

Ver preços por token →

Perguntas frequentes

O que é o Qwen3.8-Max?

É o modelo mais capaz da linha Qwen, lançado pela Alibaba em 3 de agosto de 2026. Tem 2,4 trilhões de parâmetros em arquitetura Mixture-of-Experts, cerca de 95 bilhões ativos por token, janela de 1 milhão de tokens e entrada nativa de texto, imagem e vídeo. É a primeira vez que a linha Max ganha pesos abertos, publicados junto com um modelo menor, o Qwen3.8-27B.

Dá para rodar o Qwen3.8-Max numa GPU só?

Não. Em Mixture-of-Experts todos os pesos precisam estar carregados em memória, mesmo com só uma fração ativa por token, o que exige vários nós de GPU. O caminho prático para a maioria das empresas é usar o modelo menor da mesma geração, o Qwen 3.8 27B, que cabe em uma única GPU de 45 a 48 GB quantizado em FP8.

Quanto custa usar o Qwen 3.8 27B no GPUBrasil?

Ele está no catálogo da API por token como gpub-plus, a R$ 0,69 por milhão de tokens de entrada e R$ 3,99 por milhão de tokens de saída, com 250 mil tokens de contexto, cobrado em reais no mesmo saldo das instâncias de GPU. Também dá para rodá-lo você mesmo numa GPU dedicada: uma RTX 6000 Ada de 48 GB sai por R$ 6,01 por hora.

Leia também: Comparativo de preços de API de LLM em 2026 · GLM-5.3 e o topo dos modelos abertos de código · vLLM self-hosted em 1 clique