通义千问发布 Qwen3.8-Flash,多模态 MoE 模型,Qwen4 架构早期预览 这条更新来自 x.com,发布时间为 2026-08-26,Aioga 保留原文入口以便核验。
摘要:通义千问发布 Qwen3.8-Flash,一款多模态 MoE 模型,也是 Qwen4 架构的早期预览,现已开放权重。该模型总参数量 125B,每 token 仅激活 6B,原生上下文 262K,可扩展至 1M;训练成本仅为 Qwen3.7-Plus 的 1/9,并在编码和办公任务上表现更优。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmta2x13k03t3rolwmr6pzc67
背景:公开材料披露,Qwen3.8-Flash 总参数量为 125B,每个 token 激活 6B;原生上下文长度为 262K,并可扩展至 1M。材料未说明具体扩展方式、适用条件或评测设置。
Aioga 观察:Aioga 判断,这次发布的核心信号在于将多模态 MoE、较长上下文与开放权重结合,并以 Qwen4 架构早期预览的定位对外呈现。其实际技术影响仍需结合后续模型文档、基准和部署反馈评估。
影响与后续:材料称,该模型训练成本为 Qwen3.7-Plus 的 1/9,并在编码和办公任务上表现更优。值得关注的是,相关成本与性能结论尚未在所给材料中附带测试方法、指标或任务集细节。 后续应关注通义千问是否披露权重许可、模型规格、长上下文扩展条件,以及编码和办公任务的具体基准结果。使用方在选型前也应核验多模态能力范围与实际部署成本。
