通义千问开源 Qwen3.8-Flash-Next,一款多模态 MoE 模型,也是 Qwen4 架构的早期预览。
该模型采用 GDN + QSA 混合注意力等四项升级,总参数 125B,每 token 激活 6B,训练成本约为 Qwen3.7-Plus 的 1/9,编码与办公任务能力更强。
🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmta2veap03nmrolwxllvp4ay
Tongyi Qianwen Open Source Qwen3.8-Flash-Next, a multimodal MoE model, is also an early preview of the Qwen4 architecture. This model adopts four upgrades...
Tongyi Qianwen Open Source Qwen3.8-Flash-Next, a multimodal MoE model, is also an early preview of
the Qwen4 architecture. This model adopts four upgrades including GDN + QSA hybrid attention, has a total of 125B parameters, 6B activations per token, and training costs about 1/9 of Qwen3.7-Plus, with stronger capabilities in coding and office tasks. 🔗 Read the original via AIHOT · https://aihot.virxact.com/items/cmta2veap03nmrolwxllvp4ay
通义千问开源 Qwen3.8-Flash-Next,一款多模态 MoE 模型,也是 Qwen4 架构的早期预览。
该模型采用 GDN + QSA 混合注意力等四项升级,总参数 125B,每 token 激活 6B,训练成本约为 Qwen3.7-Plus 的 1/9,编码与办公任务能力更强。
🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmta2veap03nmrolwxllvp4ay
通义千问开源 Qwen3.8-Flash-Next,并将其定位为多模态 MoE 模型及 Qwen4 架构的早期预览。材料称,该模型总参数为 125B,每 token 激活 6B。
公开材料介绍,Qwen3.8-Flash-Next 采用 GDN 与 QSA 混合注意力等四项升级,训练成本约为 Qwen3.7-Plus 的九分之一,并强调编码与办公任务能力更强。
Aioga 判断,这次发布的核心信号是架构预览与模型开源同时推进。材料对能力提升作出概括,但未提供具体评测数据,因此不宜据此断言其全面领先。
值得关注的是,125B 总参数与每 token 激活 6B 的组合,显示该模型在参数规模和单 token 激活量之间进行了取舍。其实际效率与任务表现仍需结合公开测试进一步核验。 建议持续核对 Qwen 官方后续材料,重点关注四项架构升级的完整说明、编码与办公任务的评测方法及结果,以及训练成本口径,避免仅依据摘要判断模型价值。
The readable text on this page was extracted from the public source and organized with attribution, publication time and the original link. Copyright remains with the original author and publisher.
Ingestion channel: REST API · Source domain: qwen.ai
Source: Qwen:Blog Retrieval(API
Original link: Open original source
Aioga archive: Open intelligence page
Content record: summary-fallback · Updated: 2026-08-26T12:30:00.000Z

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。
立即访问 api.w173.comAioga aggregates global AI updates and preserves source information for verification and citation.