小红书与北大提出 UltraEP,首次将基于精确路由信息的实时负载均衡引入生产系统,在每个 microbatch 和每一层动态复制热点专家。
在 Qwen3-235B 等模型上,训练吞吐平均达到理想性能的 94.6%,相比 Megatron-LM 提升 42%;
推理 prefill 吞吐相比 SGLang 提升 1.56 倍。
Xiaohongshu và Bắc Đại đề xuất UltraEP, lần đầu tiên đưa cân bằng tải thời gian thực dựa trên thông tin định tuyến chính xác vào hệ thống sản xuất, sao ché...
Xiaohongshu và Bắc Đại đề xuất UltraEP, lần đầu tiên đưa cân bằng tải thời gian thực dựa trên thông
tin định tuyến chính xác vào hệ thống sản xuất, sao chép các chuyên gia điểm nóng một cách động trong mỗi microbatch và mỗi lớp. Trên các mô hình như Qwen3-235B, thông lượng huấn luyện trung bình đạt 94,6% hiệu suất lý tưởng, tăng 42% so với Megatron-LM; thông lượng prefill suy luận tăng 1,56 lần so với SGLang.
小红书与北大提出 UltraEP,首次将基于精确路由信息的实时负载均衡引入生产系统,在每个 microbatch 和每一层动态复制热点专家。
在 Qwen3-235B 等模型上,训练吞吐平均达到理想性能的 94.6%,相比 Megatron-LM 提升 42%;
推理 prefill 吞吐相比 SGLang 提升 1.56 倍。
小红书与北大提出 UltraEP,将基于精确路由信息的实时负载均衡用于生产系统,并按每个 microbatch、每一层动态复制热点专家,以改善大规模 MoE 训练与推理的负载分配。
公开材料称,该方案面向大规模 MoE 训练与推理场景。在 Qwen3-235B 等模型上,其训练吞吐平均达到理想性能的 94.6%,相比 Megatron-LM 提升 42%。
Aioga 判断,UltraEP 的核心关注点不是静态配置专家副本,而是依据精确路由信息进行细粒度、实时调整。值得关注的是,这种机制已被材料明确描述为引入生产系统。
公开材料还称,UltraEP 的推理 prefill 吞吐相比 SGLang 提升 1.56 倍。Aioga 判断,这组结果显示实时复制热点专家可能同时影响训练吞吐与推理 prefill 阶段的效率。 值得关注的是,现有材料未披露测试环境、硬件配置、模型范围及对比参数。后续应结合完整技术报告核对“理想性能”的定义,并确认不同负载条件下结果是否一致。
当前抓取源提供的是标题、摘要、来源和原文入口,不直接搬运完整原文。完整报道请通过下方原文链接前往来源站点查看。
抓取通道: 摘要聚合 · 原始域名: mp.weixin.qq.com
Nguồn: 公众号:小红书技术(dots.llm)
原文链接: Mở nguồn gốc
Aioga 归档: 查看情报页
Content record: summary-fallback · Updated: 2026-07-20T08:00:45.000Z

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。
立即访问 api.w173.comAioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。