小红书与北大提出 UltraEP,首次将基于精确路由信息的实时负载均衡引入生产系统,在每个 microbatch 和每一层动态复制热点专家。
在 Qwen3-235B 等模型上,训练吞吐平均达到理想性能的 94.6%,相比 Megatron-LM 提升 42%;
推理 prefill 吞吐相比 SGLang 提升 1.56 倍。
小红书与北大提出 UltraEP,首次将基于精确路由信息的实时负载均衡引入生产系统,在每个 microbatch 和每一层动态复制热点专家。在 Qwen3-235B 等模型上,...
小红书与北大提出 UltraEP,首次将基于精确路由信息的实时负载均衡引入生产系统,在每个 microbatch 和每一层动态复制热点专家。
在 Qwen3-235B 等模型上,训练吞吐平均达到理想性能的 94.6%,相比 Megatron-LM 提升 42%; 推理 prefill 吞吐相比 SGLang 提升 1.56 倍。
小红书与北大提出 UltraEP,首次将基于精确路由信息的实时负载均衡引入生产系统,在每个 microbatch 和每一层动态复制热点专家。
在 Qwen3-235B 等模型上,训练吞吐平均达到理想性能的 94.6%,相比 Megatron-LM 提升 42%;
推理 prefill 吞吐相比 SGLang 提升 1.56 倍。
小红书与北大提出 UltraEP,将基于精确路由信息的实时负载均衡用于生产系统,并按每个 microbatch、每一层动态复制热点专家,以改善大规模 MoE 训练与推理的负载分配。
公开材料称,该方案面向大规模 MoE 训练与推理场景。在 Qwen3-235B 等模型上,其训练吞吐平均达到理想性能的 94.6%,相比 Megatron-LM 提升 42%。
Aioga 判断,UltraEP 的核心关注点不是静态配置专家副本,而是依据精确路由信息进行细粒度、实时调整。值得关注的是,这种机制已被材料明确描述为引入生产系统。
公开材料还称,UltraEP 的推理 prefill 吞吐相比 SGLang 提升 1.56 倍。Aioga 判断,这组结果显示实时复制热点专家可能同时影响训练吞吐与推理 prefill 阶段的效率。 值得关注的是,现有材料未披露测试环境、硬件配置、模型范围及对比参数。后续应结合完整技术报告核对“理想性能”的定义,并确认不同负载条件下结果是否一致。
本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。
抓取通道: 摘要聚合 · 原始域名: mp.weixin.qq.com
来源: 公众号:小红书技术(dots.llm)
原文链接: 打开原始来源
Aioga 归档: 查看情报页
Content record: summary-fallback · Updated: 2026-07-20T08:00:45.000Z

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。
立即访问 api.w173.comAioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。