Cursor 在声称训练吞吐量提升 41% 后将 MoK 开源

该采用 Apache 许可证的内核将 MoE 的通信与计算融合,用于在 Nvidia GB300 NVL72 机架上训练模型。

By · Published

Primary source: X

Why it matters

Cursor is spending its funding on vertical model infrastructure, and MoK shows how application companies can cut training costs by optimizing communication across entire GPU racks.

Cursor open-sources MoK after a claimed 41% training throughput gain

Cursor (@cursor_ai) 在8月4日开源了 Mixture-of-Kittens,这是一个 GPU 内核,AI 编程公司表示该内核使其 Composer 模型训练的端到端吞吐量相比先前的生产栈提高了 41%。

此次发布公开了 CEO Michael Truell (@mntruell) 和 Cursor 的研究团队在公司代码编辑器之下构建的部分模型基础设施。Truell 于 2022 年与三位 MIT 同学共同创立了 Cursor 的母公司 Anysphere。此后,Cursor 已进一步深入模型开发,在其所称的首次持续预训练运行之后,于三月推出了其 Composer 2 coding model

Mixture-of-Kittens,或称 MoK,针对的是训练 mixture-of-experts 模型时成本最高的部分之一:在持有不同专家的 GPU 之间移动 token、运行所选的前馈网络并返回结果。Cursor 的研究人员发现,根据工作负载和配置,这一层的时间消耗可能超过总训练时间的一半。

MoK 将这些通信和计算步骤结合在一个为 Nvidia GB300 NVL72 系统设计的大型内核中。一个 NVL72 机架将 72 块 GPU 连接在一个 NVLink 域中,从而创造了将数据传输与计算重叠的机会。它也迫使基础设施团队在整个机架范围内仔细协调工作,而不是孤立地优化每个矩阵乘法。

Cursor's benchmark claims

Cursor 表示,在其层级测试中,MoK 在 MXFP8 前向吞吐量上最多达到了最快公开基线的 2.37 倍。比较涵盖了使用 PyTorch 的 NCCL、使用 PyTorch 的 DeepEP、使用 Transformer Engine 的 DeepEP,以及 Nvidia 的 HybridEP 与 Megatron 配置。

该峰值数据是 Cursor 自身测试中的一项结果,而不是在每种精度模式和训练步骤中都实现的统一提升。Cursor 报告的最大增益为 MXFP8 反向执行 1.78 倍、BF16 前向执行 1.92 倍和 BF16 反向执行 1.58 倍。

在生产比较中,Cursor 在若干 GB300 NVL72 机架上测试了 512 块 GPU。公司称其之前基于 DeepEP 的栈每 GPU 处理 760.9 tokens/s,而 MoK 则处理 1,070.2 tokens/s。由此得出了报告中的 1.41 倍端到端提升。

该生产数字来自 Cursor 的内部训练系统,无法仅从公共仓库复现。然而,Cursor 已发布用于其单个 MoE 层基准测试的代码,为基础设施工程师在兼容硬件上测试这些更窄范围的性能主张提供了途径。

Cursor 表示 MoK 已经在数万块 GPU 上为 Composer 训练提供支持。该部署数字和基准结果均为公司自报。

Rebuilding the MoE layer around communication

该实现使用基于 pull 的调度,其中 GPU 从对端检索所需的 token,随后进行基于 push 的合并操作。Cursor 表示,这种安排减少了 72 块 GPU 之间的同步,并在专家负载不均时比基于 push 的调度实现了高达 29% 的 NVLink 带宽利用率提升。

MoK 在 GPU 流式多处理器之间划分通信与计算的职责,然后调整每个小批次在系统中移动的 token 数量。环形 token 缓冲区让内核在无需等待 CPU 为每个变化的 token 数量计算和分配缓冲区的情况下重用固定内存分配。

该内核还修复了浮点运算的顺序,对于相同输入产生按位相同的输出。Cursor 表示,它在内部实验和策略内强化学习的后训练阶段需要这种确定性。MoK 支持 BF16 和 MXFP8,Cursor 在生产中使用 MXFP8,同时为确保训练稳定性将共享专家保持在 BF16。

GitHub repository 在 Apache 2.0 许可证下可用。署名作者为 Stuart H. Sul、Nash Brown、Henry Wildermuth、William Lin 和 Federico Cassano。

Cursor moves further down the model stack

Cursor 的这次发布让人们看到一个起始于代码编辑器的 AI 应用下方有多少基础设施。该公司在训练专有的编程模型、在大型 GPU 集群上运行它们,并在公开实现无法充分利用性能时编写特定硬件的内核。

这项工作有大量资本支持。在其 2025 年 11 月 13 日的 Series D announcement 中,Cursor 表示已从包括 Accel、Thrive Capital、Andreessen Horowitz、Coatue、Nvidia 和 Google 在内的投资者处筹得 23 亿美元,后估值为 293 亿美元。Cursor 当时表示,这轮融资将支持更深层次的研究投入。

开源 MoK 让其他实验室可以获取经过生产测试的实现,同时邀请外部工程师检查并扩展它。直接受众仍然有限:在 GB300 NVL72 系统上训练大型 mixture-of-experts 模型的团队。那些机器成本高昂,软件也针对它们的网络和执行模型进行了定制。

此次发布也为 Cursor 提供了一个对外的研究成果,以吸引可能 otherwise 主要将公司与其编辑器联系在一起的研究人员。Cursor 表示 AI agent 帮助其小型研究团队编写了各个内核并完成了分布式大型内核的工作。MoK 是由此产生的基础设施押注:更好的编程模型将部分依赖于让每个训练集群每秒交付更多有用工作的能力。

Reader comments

Conversation for this story loads after sign-in.