El equipo Qwen, de Alibaba, abrió este miércoles (26) los pesos del Qwen3.8-Flash-Next, un modelo multimodal Mixture of Experts (MoE) que anticipa parte de la arquitectura prevista para la futura familia Qwen4. La compañía afirma haber reducido el costo de entrenamiento a aproximadamente un noveno del Qwen3.7-Plus, manteniendo solo 6 mil millones de parámetros activos por token.
El modelo combina 125 mil millones de parámetros en el núcleo principal con otros 51 mil millones en embeddings N-gram. A pesar del tamaño total, solo se activan 6 mil millones por token, una estrategia utilizada para reducir la cantidad de cómputo necesaria durante la inferencia y el entrenamiento.
La versión comercial se ofrecerá en QwenCloud como Qwen3.8-Flash, con contexto de hasta 1 millón de tokens y herramientas integradas. El precio anunciado es de US$ 0,16 por millón de tokens de entrada y US$ 0,47 por millón de tokens de salida. La API aún estaba marcada como “próximamente” en la publicación oficial.
La nueva arquitectura apunta a contextos largos
El Qwen3.8-Flash-Next introduce cambios en cuatro áreas principales: atención, conexiones residuales, embeddings y optimización del entrenamiento.
Una de las novedades es el Qwen Sparse Attention (QSA), combinado con Gated DeltaNet. Tres de cada cuatro capas usan Gated DeltaNet para condensar el historial en un estado de tamaño fijo, mientras que la capa restante recurre a la atención global para recuperar información específica a lo largo del contexto.
El QSA reduce este costo al agrupar la secuencia en pequeños bloques e identificar primero qué regiones son más relevantes. Según las pruebas publicadas por Qwen, en un contexto de 1 millón de tokens, el mecanismo logró una aceleración de hasta 7,6 veces en la etapa de prefill y 4,9 veces durante el decode.
En un escenario experimental con una tasa de acierto del 90% en el Prefix Cache, el Qwen3.8-Flash-Next registró 8,6 veces el throughput de prefill del Qwen3.7-Plus al trabajar con 1 millón de tokens.
El modelo soporta nativamente 262.144 tokens de contexto y puede ampliarse a 1 millón con YaRN, técnica utilizada para extender la ventana operativa de los modelos de lenguaje.

Alibaba aumenta la capacidad sin activar todos los parámetros
Otro cambio está en el uso de N-gram Embedding. En lugar de consultar representaciones solo a partir de un token individual, la arquitectura también considera combinaciones formadas por el token actual y su contexto local.
Qwen agregó 51 mil millones de parámetros mediante este mecanismo. Como esta información se accede por consulta y puede anticiparse, los datos pueden permanecer en la memoria del servidor y cargarse de forma asincrónica, reduciendo la necesidad de mantenerlos permanentemente en la memoria de la GPU.
La arquitectura también introduce el Gated Residual, que divide el flujo residual tradicional en cuatro rutas paralelas. Compuertas dinámicas controlan cuánto de cada flujo debe leerse o actualizarse según el contenido procesado, con el objetivo de preservar información entre capas y aumentar la estabilidad del entrenamiento.
El estado residual además puede almacenarse en FP8, un formato de menor precisión que reduce el volumen de datos movidos por la memoria durante la ejecución.

Qwen3.8-Flash supera a Claude Opus 4.6 en parte de las pruebas
En los benchmarks publicados por la propia Qwen, el nuevo modelo superó a Claude Opus 4.6 Max en varias evaluaciones, aunque no en todas.
En SWE-bench Pro, orientado a tareas reales de ingeniería de software, Qwen3.8-Flash-Next obtuvo 62,5 puntos, frente a 53,4 de Claude Opus 4.6. En SWE-bench Multilingual, los resultados fueron 81,0 y 77,5, respectivamente.
En tareas prolongadas de productividad de CoWorkBench, el modelo de Alibaba obtuvo 73,9 puntos, frente a 68,2 de Claude. En JobBench, orientado a actividades profesionales, la diferencia fue de 55,7 contra 36,6.
Qwen también se situó por delante en GPQA Diamond, con 91,7 contra 91,3, y en LiveCodeBench v6, con 91,9 contra 88,8. En cambio, en Humanity's Last Exam, Claude Opus 4.6 registró 40,0 puntos, por encima de los 35,9 de Qwen3.8-Flash-Next.
En las pruebas multimodales publicadas por la empresa, el modelo también mostró ventaja sobre Claude en tareas como uso de dispositivos Android, comprensión de videos largos, percepción de imágenes del mundo real y resolución visual de problemas matemáticos.
Las cifras son resultados presentados por la propia Qwen, bajo configuraciones y herramientas de evaluación especificadas por la compañía, y no implican superioridad del modelo en todas las categorías.
El proyecto sirve como avance del Qwen4
La apertura del Qwen3.8-Flash-Next también funciona como una presentación anticipada de la arquitectura que Alibaba pretende desarrollar en la próxima generación de la familia Qwen.
La estrategia repite el camino seguido con el Qwen3-Next, cuya arquitectura híbrida se usó posteriormente en las series Qwen3.5, Qwen3.6, Qwen3.7 y Qwen3.8. El equipo afirma que decidió liberar nuevamente los cambios antes de la siguiente generación para permitir que la comunidad evalúe la arquitectura antes de la construcción de la familia completa Qwen4.
Los pesos del Qwen3.8-Flash-Next se están poniendo a disposición a través de Hugging Face y ModelScope. El repositorio oficial también se ha abierto con documentación para ejecutar el modelo.
La versión alojada en QwenCloud será compatible con interfaces bajo el estándar de OpenAI y Anthropic. La documentación presentada por el equipo también prevé integración con herramientas de programación y agentes como Claude Code, Codex, Qwen Code, Qoder CLI y OpenClaw.
El lanzamiento amplía la información presentada inicialmente en el texto base, que destacaba la reducción de costos, los 6 mil millones de parámetros activados y la llegada del modelo a los servicios de Qwen.



