通义千问开源 Qwen3.8-Flash-Next,一款多模态 MoE 模型,也是 Qwen4 架构的早期预览。

该模型采用 GDN + QSA 混合注意力等四项升级,总参数 125B,每 token 激活 6B,训练成本约为 Qwen3.7-Plus 的 1/9,编码与办公任务能力更强。

🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmta2veap03nmrolwxllvp4ay