小红书与北大提出 UltraEP,首次将基于精确路由信息的实时负载均衡引入生产系统,在每个 microbatch 和每一层动态复制热点专家。
在 Qwen3-235B 等模型上,训练吞吐平均达到理想性能的 94.6%,相比 Megatron-LM 提升 42%;
推理 prefill 吞吐相比 SGLang 提升 1.56 倍。
Xiaohongshu und Peking University haben UltraEP vorgeschlagen, das erstmals ein auf präzisen Routing-Informationen basierendes Echtzeit-Load-Balancing in P...
Xiaohongshu und Peking University haben UltraEP vorgeschlagen, das erstmals ein auf präzisen
Routing-Informationen basierendes Echtzeit-Load-Balancing in Produktionssysteme einführt und in jedem Microbatch sowie in jeder Schicht dynamisch Hotspot-Experten dupliziert. Bei Modellen wie Qwen3-235B erreicht der Trainingsthroughput im Durchschnitt 94,6 % der idealen Leistung, was im Vergleich zu Megatron-LM eine Steigerung von 42 % bedeutet; der Inferenz-Prefill-Throughput steigt im Vergleich zu SGLang um das 1,56-fache.
小红书与北大提出 UltraEP,首次将基于精确路由信息的实时负载均衡引入生产系统,在每个 microbatch 和每一层动态复制热点专家。
在 Qwen3-235B 等模型上,训练吞吐平均达到理想性能的 94.6%,相比 Megatron-LM 提升 42%;
推理 prefill 吞吐相比 SGLang 提升 1.56 倍。
小红书与北大提出 UltraEP,将基于精确路由信息的实时负载均衡用于生产系统,并按每个 microbatch、每一层动态复制热点专家,以改善大规模 MoE 训练与推理的负载分配。
公开材料称,该方案面向大规模 MoE 训练与推理场景。在 Qwen3-235B 等模型上,其训练吞吐平均达到理想性能的 94.6%,相比 Megatron-LM 提升 42%。
Aioga 判断,UltraEP 的核心关注点不是静态配置专家副本,而是依据精确路由信息进行细粒度、实时调整。值得关注的是,这种机制已被材料明确描述为引入生产系统。
公开材料还称,UltraEP 的推理 prefill 吞吐相比 SGLang 提升 1.56 倍。Aioga 判断,这组结果显示实时复制热点专家可能同时影响训练吞吐与推理 prefill 阶段的效率。 值得关注的是,现有材料未披露测试环境、硬件配置、模型范围及对比参数。后续应结合完整技术报告核对“理想性能”的定义,并确认不同负载条件下结果是否一致。
当前抓取源提供的是标题、摘要、来源和原文入口,不直接搬运完整原文。完整报道请通过下方原文链接前往来源站点查看。
抓取通道: 摘要聚合 · 原始域名: mp.weixin.qq.com
Quelle: 公众号:小红书技术(dots.llm)
原文链接: Originalquelle öffnen
Aioga 归档: 查看情报页
Content record: summary-fallback · Updated: 2026-07-20T08:00:45.000Z

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。
立即访问 api.w173.comAioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。