通义千问发布 Qwen3.8-Flash,一款多模态 MoE 模型,也是 Qwen4 架构的早期预览,现已开放权重。

该模型总参数量 125B,每 token 仅激活 6B,原生上下文 262K,可扩展至 1M;

训练成本仅为 Qwen3.7-Plus 的 1/9,并在编码和办公任务上表现更优。

🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmta2x13k03t3rolwmr6pzc67