Aioga
AI资讯 / 产品更新
返回 AI资讯

Cursor 开源 Mixture-of-Kittens (MoK):面向 GB300 NVL72 机架的确定性 MoE 训练 Megakernel

MarkTechPost(RSS)Aioga 编辑团队2026-08-04T18:38:41.000Z热度 30

Cursor Research 开源了其 Composer 模型背后的 MoE 训练 megakernel--Mixture-of-Kittens (MoK),将全部通信与计算...

产品更新MarkTechPost(RSS)

今日 AI 情报摘要

Cursor Research 开源了其 Composer 模型背后的 MoE 训练 megakernel--Mixture-of-Kittens

(MoK),将全部通信与计算融合进单一确定性内核,较最强公开基线最高提速 2.37 倍,并已在数万 GPU 上支撑 Composer 训练。

中文正文 · AI 翻译

Cursor Research 已开源 Mixture-of-Kittens (MoK):https://cursor.com/blog/mixture-of-kittens,这是其 Composer 背后的混合专家训练超核:https://cursor.com/blog/composer-2 模型。MoK 将每个 MoE 的通信和计算步骤融合为一个确定性核。Cursor 团队报告称,其吞吐量比最强的公开基线高出最多 2.37 倍。它已经为数万 GPU 的 Composer 训练提供了支持。

是的,但硬件门槛很高。MoK 在 GitHub:https://github.com/cursor/mixture-of-kittens 上以 Apache-2.0 协议开源。它需要 NVIDIA Blackwell SM100 或 SM103 GPU,这意味着 GB200 NVL72 或 GB300 NVL72 机架。此外,还需要 Python 3.12+、PyTorch 2.10+ 和 CUDA 工具包 13.0+。GPU 之间的缓冲区依赖于 PyTorch 对称内存。

这限制了现实中的采用者,仅限拥有或租用 NVL72 容量的组织。前沿实验室、获得资金的模型初创公司、GPU 新云以及国家计算中心符合条件。单节点团队和 8-GPU 小型团队则不适用。

应用范围狭窄但价值高。包括 DeepSeek-V3 风格 MoE 模型的预训练和后训练。确定性也使其在策略内 RL 后训练和内部消融实验中有用。相关行业包括 AI 模型开发、云 GPU 基础设施、代码生成工具以及量化研究。

Cursor 早期的工作覆盖了计算方面。研究团队编写了自己的 MXFP8 和 NVFP4 训练核心:https://cursor.com/blog/kernels,以及用于 MoE 推理的“warp decode”路径:https://cursor.com/blog/warp-decode。这些假设 GPU 之间的通信是单独处理的。

在生产中,通信成为限制因素。MoE 层可能消耗超过端到端训练时间的一半。迁移到 GB300 NVL72 改变了问题。一机架内有 72 个 GPU,位于同一 NVLink 域内,这允许细粒度的重叠。但与 GPU 相比,集成的 Grace CPU 速度较慢。因此必须积极最小化 CPU 与 GPU 的同步。

MoK 构建为一个巨内核(megakernel):https://hazyresearch.stanford.edu/blog/2025-05-27-no-bubbles,并且是完全确定性的。它支持 BF16 和 MXFP8 精度模式。调度通过 Blackwell 的 Cluster Launch Control 运行,因此机架间的 RDMA 不会在其后排队。路由器权重梯度使用 SonicMoE:https://arxiv.org/abs/2512.14080 风格的计算,融合到 SwiGLU 的反向传播中。

Cursor 开源 Mixture-of-Kittens (MoK):面向 GB300 NVL72 机架的确定性 MoE 训练 Megakernel

层基准测试在单个 NVL72 机架上以 EP 等级 64 运行。每个 GPU 在路由之前持有 2,048 个令牌。基线包括 NCCL+PyTorch、DeepEP+PyTorch、DeepEP+TransformerEngine 和 HybridEP+Megatron。覆盖的模型包括 Kimi K2.7 代码、GLM-5.2、Qwen3.5-397B-A17B 和 DeepSeek-V4-Pro。

相比最快的基准,MoK 的 MXFP8 正向运算速度最多提高 2.37 倍。其他数据为 MXFP8 反向运算 1.78 倍、BF16 正向运算 1.92 倍、BF16 反向运算 1.58 倍。端到端测试使用了跨多个 GB300 NVL72 机架的 512 个 GPU。每个 GPU 的每秒 token 数从 760.9 上升到 1,070.2,提升 1.41 倍。

需要与我们合作推广您的 GitHub 仓库、Hugging Face 页面、产品发布或网络研讨会等吗?请联系我们: https://forms.gle/wbash1wF6efRj8G58

Cursor 开源 Mixture-of-Kittens (MoK):面向 GB300 NVL72 机架的确定性 MoE 训练 Megakernel

Asif Razzaq 是 Marktechpost Media Inc. 的 CEO。作为一位有远见的企业家和工程师,Asif 致力于利用人工智能的潜力来造福社会。他最近的项目是推出人工智能媒体平台 Marktechpost,该平台以深入报道机器学习和深度学习新闻而闻名,内容既具有技术性,又容易被广大读者理解。该平台每月访问量超过 200 万,显示出其在受众中的受欢迎程度。

Building an Advanced AI Skill Security Auditing Pipeline with NVIDIA SkillSpector, LangGraph, YARA Rules, SARIF, and CI Policy Gates
Y Combinator Open-Sources QM: An MIT-Licensed Multiplayer Agent Harness That Runs In Slack And The Web
Genspark Open Sources GenOffice: A Free, Ad-Free AI Office Suite for macOS and Windows with Docs, Sheets, Slides, PDF

[免费指南] 保护 AI 代理、MCP 服务器及 LLM 应用:https://pxllnk.co/lxn88m

情报判断

Aioga 编辑摘要

Aioga 编辑摘要:Cursor Research 开源了其 Composer 模型背后的 MoE 训练 megakernel--Mixture-of-Kittens Aioga 将其归入「产品更新」方向,重点关注它对真实使用和行业竞争的影响。

背景分析

背景分析:模型与研究类动态需要结合能力边界、开放方式、成本、可用性和真实任务表现判断,单项指标领先不等于已经形成稳定采用。

Aioga 观点

Aioga 判断:这条动态更适合作为行业观察信号,当前信息足以建立线索,但不足以推导长期结论。

影响与后续

影响分析:对相关团队而言,短期应先核对来源、可用范围和实际成本,再判断是否值得接入或跟进。 后续观察:继续观察官方文档、实际可用性、价格变化、开发者反馈和竞品回应。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: marktechpost.com

来源: MarkTechPost(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-08-04T18:38:41.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

Cursor Research 开源了其 Composer 模型背后的 MoE 训练 megakernel--Mixture-of-Kittens (MoK),将全部通信与计算...

MarkTechPost(RSS)2026-08-04T18:38:41.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。