小红书与北大提出 UltraEP,首次将基于精确路由信息的实时负载均衡引入生产系统,在每个 microbatch 和每一层动态复制热点专家。
在 Qwen3-235B 等模型上,训练吞吐平均达到理想性能的 94.6%,相比 Megatron-LM 提升 42%;
推理 prefill 吞吐相比 SGLang 提升 1.56 倍。
小红書と北大は UltraEP を提案し、初めて正確なルーティング情報に基づくリアルタイム負荷分散を生産システムに導入し、各マイクロバッチと各層でホットスポットの専門家を動的に複製します。Qwen3-235B などのモデルでは、訓練スループットは平均で理想的な性能の 94.6% に達し、Megatron-LM...
小红書と北大は UltraEP を提案し、初めて正確なルーティング情報に基づくリアルタイム負荷分散を生産システムに導入し、各マイクロバッチと各層でホットスポットの専門家を動的に複製します。
Qwen3-235B などのモデルでは、訓練スループットは平均で理想的な性能の 94.6% に達し、Megatron-LM と比べて 42% 向上しています; 推論 prefill スループットは SGLang と比べて 1.56 倍向上しています。
小红书与北大提出 UltraEP,首次将基于精确路由信息的实时负载均衡引入生产系统,在每个 microbatch 和每一层动态复制热点专家。
在 Qwen3-235B 等模型上,训练吞吐平均达到理想性能的 94.6%,相比 Megatron-LM 提升 42%;
推理 prefill 吞吐相比 SGLang 提升 1.56 倍。
小红书与北大提出 UltraEP,将基于精确路由信息的实时负载均衡用于生产系统,并按每个 microbatch、每一层动态复制热点专家,以改善大规模 MoE 训练与推理的负载分配。
公开材料称,该方案面向大规模 MoE 训练与推理场景。在 Qwen3-235B 等模型上,其训练吞吐平均达到理想性能的 94.6%,相比 Megatron-LM 提升 42%。
Aioga 判断,UltraEP 的核心关注点不是静态配置专家副本,而是依据精确路由信息进行细粒度、实时调整。值得关注的是,这种机制已被材料明确描述为引入生产系统。
公开材料还称,UltraEP 的推理 prefill 吞吐相比 SGLang 提升 1.56 倍。Aioga 判断,这组结果显示实时复制热点专家可能同时影响训练吞吐与推理 prefill 阶段的效率。 值得关注的是,现有材料未披露测试环境、硬件配置、模型范围及对比参数。后续应结合完整技术报告核对“理想性能”的定义,并确认不同负载条件下结果是否一致。
取得元が提供するタイトル、要約、出典、元記事リンクを掲載しています。記事全文は転載していません。
取得経路: 要約集約 · 元ドメイン: mp.weixin.qq.com
出典: 公众号:小红书技术(dots.llm)
元記事: 元記事を開く
Aioga アーカイブ: 情報ページを開く
Content record: summary-fallback · Updated: 2026-07-20T08:00:45.000Z

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。
立即访问 api.w173.comAioga は世界の AI 動向を集約し、確認と引用のため出典情報を保持します。