Qwen3.8-Max: o modelo de programação com pesos abertos de 2,4T da Alibaba
O modelo mais capaz da Alibaba até hoje — um MoE de 2,4 trilhões de parâmetros para programação e trabalho colaborativo, com pesos abertos e um checkpoint de 27B a caminho.

Qwen3.8-Max é o novo grande modelo de linguagem flagship da Alibaba — um Mixture-of-Experts (MoE) de 2,4 trilhões de parâmetros que a equipe do Qwen chama de seu “modelo mais capaz até hoje”. Ele foi projetado diretamente para programação e “trabalho colaborativo”: tarefas autônomas de longo horizonte nas quais um agente planeja, executa e se autocorrige com pouca intervenção humana. Para quem desenvolve, a grande notícia é que os pesos serão abertos. A seguir, explicamos o que o Qwen3.8-Max realmente é, quanto custa, o que está confirmado e o que ainda não foi resolvido, além de seu lugar em uma stack de agentes real.
O que é o Qwen3.8-Max?
O Qwen3.8-Max é um modelo MoE esparso de 2,4 trilhões de parâmetros criado pela equipe Qwen da Alibaba e posicionado como o integrante mais poderoso da família Qwen. A Alibaba já o disponibiliza amplamente em seus serviços hospedados e confirmou que os pesos abertos chegam pouco depois do lançamento, junto com um segundo checkpoint bem menor — o Qwen3.8-27B — voltado para equipes que pretendem executar o modelo em hardware próprio. (MarkTechPost)
Dois pontos tornam o lançamento relevante. Primeiro, se os pesos forem publicados como prometido, esta será a primeira vez que a Alibaba abre um modelo Qwen da classe Max: o nível flagship, e não um derivado destilado. (How2Shout) Segundo, o modelo é multimodal por design: recebe texto, imagem e vídeo e retorna texto, usando visão como parte do ciclo de execução, e não apenas como um canal de entrada unidirecional. (MarkTechPost)
Especificações em resumo
Com base no anúncio da Alibaba e na cobertura inicial, estes são os principais dados disponíveis:
- 2,4T de parâmetros totais em uma arquitetura MoE esparsa. Esse número colocaria o Qwen3.8-Max entre os maiores modelos de pesos abertos já anunciados — acima do DeepSeek V4 Pro (~1,6T), mas abaixo do Kimi K3, com 2,8T. (techsy)
- A cobertura do lançamento relata um contexto de aproximadamente 1 milhão de tokens, suficiente para manter um repositório inteiro ou um grande conjunto de documentos em contexto. (How2Shout)
- Entrada multimodal nativa — texto, imagem e vídeo entram; texto sai. (MarkTechPost)
- API compatível com OpenAI e DashScope, de modo que integrar o modelo em uma stack existente exige basicamente trocar a URL-base e o ID do modelo. (MarkTechPost)
- Qwen3.8-27B — um segundo checkpoint que também terá pesos abertos e cabe de forma muito mais realista em GPUs locais comuns. (How2Shout)
Há uma lacuna importante: a Alibaba não divulgou a quantidade de parâmetros ativados, ou seja, quantos dos 2,4T são usados de fato por token. Em um MoE esparso, é esse número, e não o total, que determina o custo de serving. Sem ele, ainda não é possível estimar o custo de inferência dos pesos abertos. (MarkTechPost)
As capacidades que a Alibaba está promovendo
A equipe Qwen apresentou o Qwen3.8-Max para trabalhos autônomos de longo horizonte, não para conversas isoladas. Segundo os materiais de lançamento da Alibaba, as principais demonstrações incluem: (latent.space)
- Programação autônoma por vários dias — uma execução de desenvolvimento autoevolutiva que começou em uma pasta vazia e avançou em direção a um projeto funcional por mais de 10 dias, com o rastreamento completo publicado no GitHub.
- Planejamento de longo horizonte — planejamento autônomo em nível de sistema com aprendizado em ciclo fechado, demonstrado por mais de 500 turnos de otimização de design de chips e uma simulação de estratégia de e-commerce de 365 dias.
- Pesquisa autônoma — a Alibaba afirma que o modelo reconstruiu do zero o pipeline de um artigo científico e iterou por cerca de 125 horas para produzir um método de seleção de dados que superou por pequena margem o benchmark original. (latent.space)
- Ciclos de feedback multimodais — uso contínuo da visão para planejar, executar e se autocorrigir, e não apenas como entrada. (MarkTechPost)
Essas são alegações do fornecedor baseadas em demonstrações de lançamento. Elas apontam uma direção interessante — toda a indústria busca agentes capazes de funcionar por horas ou dias sem supervisão —, mas ainda não são benchmarks verificados por terceiros. Trate-as como ponto de partida, não como veredicto definitivo.
Preços
A Alibaba publicou os preços da API junto com o lançamento: (latent.space)
| Preço por 1M de tokens | |
|---|---|
| Entrada | $2.00 |
| Saída | $6.00 |
| Entrada em cache | $0.25 |
O valor fica muito abaixo da maioria dos modelos frontier dos Estados Unidos e também é inferior ao preço hospedado do Kimi K3 (~$3 de entrada / $15 de saída), mantendo a forte competição de preços entre laboratórios chineses. A entrada em cache barata favorece cargas que reutilizam um contexto fixo grande — exatamente o padrão de muitos agentes de programação e documentos.
O que está confirmado e o que não está
O lançamento avançou rapidamente e a cobertura é desigual, por isso vale separar as duas categorias.
Razoavelmente confirmado:
- 2,4T de parâmetros totais e um plano de abrir os pesos, segundo o anúncio da Alibaba. (techsy)
- A API já está disponível e é compatível com OpenAI e DashScope. (MarkTechPost)
- Preços publicados de $2 / $6 / $0.25 por milhão de tokens. (latent.space)
- Um segundo checkpoint de pesos abertos, o Qwen3.8-27B. (How2Shout)
Ainda não definido:
- A quantidade de parâmetros ativados e a configuração MoE completa, portanto o custo real de serving permanece desconhecido. (MarkTechPost)
- Uma tabela completa e independente de benchmarks. A cobertura inicial observou que os materiais de lançamento ainda não traziam um conjunto completo; espere resultados de terceiros antes de apostar um fluxo de trabalho crítico no modelo. (MarkTechPost)
- A licença exata e se o checkpoint publicado corresponde à prévia. “Pesos abertos” normalmente significa que os pesos podem ser baixados, não necessariamente que os dados e o código de treinamento sejam publicados ou que exista uma licença aprovada pela OSI. (coursiv)
A leitura honesta é que o Qwen3.8-Max existe e já está disponível, e a promessa de pesos abertos está registrada. Porém, os números necessários para planejar capacidade de produção ainda não são totalmente públicos.
Você consegue executá-lo de verdade?
Para a maioria das equipes, auto-hospedar o flagship de 2,4T não é realista. Um checkpoint de 2,4 trilhões de parâmetros é um artefato de data center multinó; nenhum desenvolvedor individual o executará em uma workstation, e muitas empresas também não conseguirão hospedá-lo. (How2Shout)
É por isso que o Qwen3.8-27B é a opção mais prática. Seu tamanho é adequado para GPUs locais comuns e, para a maioria dos cenários de auto-hospedagem, o 27B — não o flagship — é o caminho realista de implantação. (MarkTechPost) Se o objetivo for residência de dados ou controle de custos em hardware próprio, planeje em torno do 27B; se você quer o limite de capacidade do flagship, a API hospedada é a opção imediata.
Como o Qwen3.8-Max se encaixa na corrida dos pesos abertos
O Qwen3.8-Max chega após algumas semanas movimentadas para grandes modelos de pesos abertos. Ele sucede o Kimi K3, de 2,8T, da Moonshot AI, e o Inkling da Thinking Machines, além de ficar acima do DeepSeek V4 Pro em número total de parâmetros. (techsy) O sinal competitivo é claro: modelos de pesos abertos em escala frontier estão surgindo quase mensalmente, e a distância entre modelos abertos e fechados continua diminuindo.
Para quem desenvolve, a conclusão prática não é escolher um único “vencedor”. Agora existem vários modelos frontier confiáveis, econômicos e, em princípio, auto-hospedáveis. A vantagem vem de direcionar cada tarefa ao modelo certo.
Coloque um modelo como o Qwen3.8-Max para trabalhar na sua própria equipe de IA
Um modelo frontier gera valor quando está conectado ao trabalho real — repositórios, documentos, terminais e planos de várias etapas —, não apenas a uma caixa de chat. É para isso que serve uma plataforma multiagente independente de modelo: direcionar programação de longo horizonte para um modelo como o Qwen3.8-Max, usar modelos mais baratos em etapas rotineiras e orquestrar todos eles em tarefas reais. Eigent é um aplicativo desktop Cowork de código aberto que executa localmente uma equipe de IA multiagente, permitindo escolher o melhor modelo para cada tarefa e manter dados sensíveis em sua própria máquina. Veja como agentes podem revisar PRs do GitHub do início ao fim e depois baixe o Eigent para experimentar.
Perguntas frequentes
O que é o Qwen3.8-Max?
Qwen3.8-Max é o grande modelo de linguagem flagship da Alibaba — um Mixture-of-Experts esparso de 2,4 trilhões de parâmetros, criado para programação e trabalho com agentes de longo horizonte. A Alibaba o chama de seu modelo mais capaz até hoje e se comprometeu a abrir seus pesos junto com um checkpoint Qwen3.8-27B menor.
O Qwen3.8-Max é open source?
A Alibaba afirmou que os pesos do Qwen3.8-Max e do Qwen3.8-27B serão publicados abertamente. “Pesos abertos” em geral significa que os pesos podem ser baixados — não necessariamente que os dados ou o código de treinamento sejam incluídos, nem que a licença seja aprovada pela OSI. A licença exata não estava totalmente detalhada no lançamento; confirme os termos antes de depender de direitos de redistribuição.
Quanto custa o Qwen3.8-Max?
Os preços publicados pela Alibaba são $2.00 por milhão de tokens de entrada, $6.00 por milhão de tokens de saída e $0.25 por milhão de tokens de entrada em cache — muito abaixo da maioria dos modelos frontier dos Estados Unidos.
Posso executar o Qwen3.8-Max por conta própria?
O flagship de 2,4T exige um data center multinó e está fora do alcance de auto-hospedagem para a maioria das pessoas e empresas. O checkpoint menor Qwen3.8-27B é o caminho local realista para GPUs comuns; para o flagship, a API hospedada é a opção de curto prazo.
Como o Qwen3.8-Max se compara ao Kimi K3?
Em número total de parâmetros, o Qwen3.8-Max (2,4T) é menor que o Kimi K3 (2,8T), mas maior que o DeepSeek V4 Pro (~1,6T). Seus preços de API são inferiores aos do K3. A comparação direta de qualidade terá de esperar por benchmarks independentes, que não estavam completos no lançamento.
Posso usar o Qwen3.8-Max com uma plataforma multiagente como o Eigent?
Sim. A API é compatível com OpenAI e DashScope, então uma plataforma independente de modelo como o Eigent pode direcionar tarefas de programação e conhecimento ao Qwen3.8-Max, usar outros modelos em etapas rotineiras e manter os dados localmente quando necessário.
Recent Posts

Thinking Machines Inkling-Small: Um Modelo de 276B Que Supera Seu Irmão Maior
O Inkling-Small do Thinking Machines Lab é um MoE de pesos abertos com 276B que iguala o Inkling com um quarto do tamanho. Especificações, benchmarks, preços e por que isso importa.

Alternativa ao Augment Code
Compare alternativas ao Augment Code para grandes bases de código por preço atual, uso compartilhado, qualidade de contexto, acesso ao código, auto-hospedagem, segurança e adequação à equipe.

Melhores agentes de programação com IA open source
Compare os melhores agentes de programação com IA open source por licença, interface, auto-hospedagem, escolha de modelo, aprovações, segurança, manutenção e adequação prática atual.