小红书与北大提出 UltraEP,首次将基于精确路由信息的实时负载均衡引入生产系统,在每个 microbatch 和每一层动态复制热点专家。
在 Qwen3-235B 等模型上,训练吞吐平均达到理想性能的 94.6%,相比 Megatron-LM 提升 42%;
推理 prefill 吞吐相比 SGLang 提升 1.56 倍。
शाओहोंगशु और बेइजिंग यूनिवर्सिटी ने UltraEP पेश किया, जो पहली बार सटीक रूटिंग जानकारी पर आधारित रीयल-टाइम लोड बैलेंसिंग को प्रोडक्शन सिस्टम में लाता है, प्...
शाओहोंगशु और बेइजिंग यूनिवर्सिटी ने UltraEP पेश किया, जो पहली बार सटीक रूटिंग जानकारी पर आधारित
रीयल-टाइम लोड बैलेंसिंग को प्रोडक्शन सिस्टम में लाता है, प्रत्येक माइक्रोबैच और प्रत्येक लेयर में हॉटस्पॉट विशेषज्ञों की डायनामिक नकल करता है। Qwen3-235B जैसी मॉडलों पर, ट्रेनिंग थ्रूपुट औसतन आदर्श प्रदर्शन का 94.6% तक पहुंचता है, Megatron-LM की तुलना में 42% सुधार; इंफरेंस प्रीफिल थ्रूपुट SGLang की तुलना में 1.56 गुना बढ़ गया।
小红书与北大提出 UltraEP,首次将基于精确路由信息的实时负载均衡引入生产系统,在每个 microbatch 和每一层动态复制热点专家。
在 Qwen3-235B 等模型上,训练吞吐平均达到理想性能的 94.6%,相比 Megatron-LM 提升 42%;
推理 prefill 吞吐相比 SGLang 提升 1.56 倍。
小红书与北大提出 UltraEP,将基于精确路由信息的实时负载均衡用于生产系统,并按每个 microbatch、每一层动态复制热点专家,以改善大规模 MoE 训练与推理的负载分配。
公开材料称,该方案面向大规模 MoE 训练与推理场景。在 Qwen3-235B 等模型上,其训练吞吐平均达到理想性能的 94.6%,相比 Megatron-LM 提升 42%。
Aioga 判断,UltraEP 的核心关注点不是静态配置专家副本,而是依据精确路由信息进行细粒度、实时调整。值得关注的是,这种机制已被材料明确描述为引入生产系统。
公开材料还称,UltraEP 的推理 prefill 吞吐相比 SGLang 提升 1.56 倍。Aioga 判断,这组结果显示实时复制热点专家可能同时影响训练吞吐与推理 prefill 阶段的效率。 值得关注的是,现有材料未披露测试环境、硬件配置、模型范围及对比参数。后续应结合完整技术报告核对“理想性能”的定义,并确认不同负载条件下结果是否一致。
当前抓取源提供的是标题、摘要、来源和原文入口,不直接搬运完整原文。完整报道请通过下方原文链接前往来源站点查看。
抓取通道: 摘要聚合 · 原始域名: mp.weixin.qq.com
स्रोत: 公众号:小红书技术(dots.llm)
原文链接: मूल स्रोत खोलें
Aioga 归档: 查看情报页
Content record: summary-fallback · Updated: 2026-07-20T08:00:45.000Z

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。
立即访问 api.w173.comAioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。