A equipe Qwen, da Alibaba, abriu nesta quarta-feira (26) os pesos do Qwen3.8-Flash-Next, um modelo multimodal Mixture of Experts (MoE) que antecipa parte da arquitetura prevista para a futura família Qwen4. A companhia afirma ter reduzido o custo de treinamento para cerca de um nono do Qwen3.7-Plus, mantendo apenas 6 bilhões de parâmetros ativos por token.

O modelo combina 125 bilhões de parâmetros no núcleo principal com outros 51 bilhões em embeddings N-gram. Apesar do tamanho total, apenas 6 bilhões são ativados a cada token, estratégia usada para reduzir a quantidade de computação necessária durante inferência e treinamento.

A versão comercial será oferecida no QwenCloud como Qwen3.8-Flash, com contexto de até 1 milhão de tokens e ferramentas integradas. O preço anunciado é de US$ 0,16 por milhão de tokens de entrada e US$ 0,47 por milhão de tokens de saída. A API ainda estava marcada como “em breve” na publicação oficial.

Nova arquitetura mira contextos longos

O Qwen3.8-Flash-Next introduz mudanças em quatro áreas principais: atenção, conexões residuais, embeddings e otimização do treinamento.

Uma das novidades é o Qwen Sparse Attention (QSA), combinado ao Gated DeltaNet. Três de cada quatro camadas usam o Gated DeltaNet para condensar o histórico em um estado de tamanho fixo, enquanto a camada restante recorre à atenção global para recuperar informações específicas ao longo do contexto.

O QSA reduz esse custo ao agrupar a sequência em pequenos blocos e identificar primeiro quais regiões são mais relevantes. Segundo os testes divulgados pela Qwen, em um contexto de 1 milhão de tokens, o mecanismo alcançou aceleração de até 7,6 vezes na etapa de prefill e 4,9 vezes durante o decode.

Em um cenário experimental com taxa de acerto de 90% no Prefix Cache, o Qwen3.8-Flash-Next registrou 8,6 vezes o throughput de prefill do Qwen3.7-Plus ao trabalhar com 1 milhão de tokens.

O modelo suporta nativamente 262.144 tokens de contexto e pode ser ampliado para 1 milhão com YaRN, técnica usada para estender a janela operacional de modelos de linguagem.

Model Architecture
Model Architecture

Alibaba aumenta capacidade sem ativar todos os parâmetros

Outra mudança está no uso de N-gram Embedding. Em vez de consultar representações apenas a partir de um token individual, a arquitetura também considera combinações formadas pelo token atual e seu contexto local.

A Qwen adicionou 51 bilhões de parâmetros por meio desse mecanismo. Como essas informações são acessadas por consulta e podem ser antecipadas, os dados podem permanecer na memória do servidor e ser carregados de forma assíncrona, reduzindo a necessidade de mantê-los permanentemente na memória da GPU.

A arquitetura também introduz o Gated Residual, que divide o fluxo residual tradicional em quatro caminhos paralelos. Portas dinâmicas controlam quanto de cada fluxo deve ser lido ou atualizado conforme o conteúdo processado, com o objetivo de preservar informações entre camadas e aumentar a estabilidade do treinamento.

O estado residual ainda pode ser armazenado em FP8, formato de menor precisão que reduz o volume de dados movimentado pela memória durante a execução.

Put simply: GDN efficiently “remembers,” while QSA precisely “retrieves.”
Put simply: GDN efficiently “remembers,” while QSA precisely “retrieves.”

Qwen3.8-Flash supera Claude Opus 4.6 em parte dos testes

Nos benchmarks divulgados pela própria Qwen, o novo modelo superou o Claude Opus 4.6 Max em várias avaliações, embora não em todas.

No SWE-bench Pro, voltado a tarefas reais de engenharia de software, o Qwen3.8-Flash-Next marcou 62,5 pontos, contra 53,4 do Claude Opus 4.6. No SWE-bench Multilingual, os resultados foram 81,0 e 77,5, respectivamente.

Em tarefas prolongadas de produtividade do CoWorkBench, o modelo da Alibaba obteve 73,9 pontos, ante 68,2 do Claude. No JobBench, voltado a atividades profissionais, a diferença foi de 55,7 contra 36,6.

O Qwen também ficou à frente no GPQA Diamond, com 91,7 contra 91,3, e no LiveCodeBench v6, com 91,9 contra 88,8. Já no Humanity's Last Exam, o Claude Opus 4.6 registrou 40,0 pontos, acima dos 35,9 do Qwen3.8-Flash-Next.

Nos testes multimodais divulgados pela empresa, o modelo também apresentou vantagem sobre o Claude em tarefas como uso de dispositivos Android, compreensão de vídeos longos, percepção de imagens do mundo real e resolução visual de problemas matemáticos.

Os números são resultados apresentados pela própria Qwen, sob configurações e ferramentas de avaliação especificadas pela companhia, e não significam superioridade do modelo em todas as categorias.

Projeto serve como prévia do Qwen4

A abertura do Qwen3.8-Flash-Next também funciona como uma apresentação antecipada da arquitetura que a Alibaba pretende desenvolver na próxima geração da família Qwen.

A estratégia repete o caminho seguido com o Qwen3-Next, cuja arquitetura híbrida posteriormente foi usada nas séries Qwen3.5, Qwen3.6, Qwen3.7 e Qwen3.8. A equipe afirma que decidiu liberar novamente as mudanças antes da geração seguinte para permitir que a comunidade avalie a arquitetura antes da construção da família completa Qwen4.

Os pesos do Qwen3.8-Flash-Next estão sendo disponibilizados pelo Hugging Face e ModelScope. O repositório oficial também foi aberto com documentação para execução do modelo.

A versão hospedada no QwenCloud será compatível com interfaces no padrão da OpenAI e da Anthropic. A documentação apresentada pela equipe também prevê integração com ferramentas de programação e agentes como Claude Code, Codex, Qwen Code, Qoder CLI e OpenClaw.

O lançamento amplia as informações inicialmente apresentadas no texto-base, que destacava a redução de custos, os 6 bilhões de parâmetros ativados e a chegada do modelo aos serviços da Qwen.

Continue no Radar