Moonshot 发布 Kimi K3 报告,详细说明 2.8T 开放模型的运行方式。

7月27日的报告详述了混合注意力、896个专家中路由到16个专家的机制,以及仍需数据中心规模的服务堆栈。

By · Published

Primary source: X

Why it matters

K3 shows that open weights alone do not make a frontier model practical. Draft models, cache systems and accelerator-scale serving now shape distribution and cost.

Illustration of Moonshot's Kimi K3 2.8T model architecture showing hybrid attention, 16-of-896 expert routing, and a data-center scale serving stack.

Zhilin Yang 的 Moonshot AI 于 7 月 27 日 发布 了 完整 权重 和 Kimi K3 的技术报告,记录了该模型的架构和基础设施——这是一个拥有 2.8 万亿参数的模型,每个 token 激活 1040 亿参数。

此次发布紧随 K3 在 7 月 16 日 的推出:当时 Moonshot AI 开始通过 Kimi、Kimi Work、Kimi Code 及其 API 提供该模型。这家北京开发者 曾 承诺 在 7 月 27 日 之前 发布 权重 和 报告。其 公开的 GitHub 仓库 现在 已 包含 权重许可、模型规格 和 部署说明。

Yang 在他的研究生涯中 大量 工作 都 面向 K3 旨在解决的问题:使语言模型在长序列上保持并检索信息。在 2023 年 创立 Moonshot AI 之前,他 合著 了 Transformer-XL 和 XLNet,在 Carnegie Mellon University 获得 博士学位,并 曾 在 Meta AI 和 Google Brain 工作。Moonshot AI 联合创始人 Yuxin Wu 之前 在 Google Brain 从事基础模型工作,并 创建 了 Meta 的 Detectron2 计算机视觉库。

Meta AI 研究员 Zhuokai Zhao (@zhuokaiz) 在 7 月 30 日 提出,报告 中 的 五 个 算法级 选择 值得更仔细 地 审视。他 的 第一个 例子 暴露 了 “开放模型” 这一短语 的 一个 重要 边界:Zhao 写道,Moonshot AI 发布 了 K3 的 主权重,但 保留 了 自己 的 speculative-decoding 草稿模型。

一个 独立 实现 已 经 填补 了 这一 空白。Inferact 发布 了 一个 开放 的 Kimi K3 DSpark 草稿模型,并且 vLLM 为其 添加 了 生产 支持。speculative decoding 使用 一个 更小 的模型 来 提议 若干 token,随后 主模型 并行 验证 这些 token,从而 减少 用户 在 生成 token 之间 所 感受到 的 延迟。

架构 围绕 推理 成本 构建

K3 结合了 两种 注意力 系统。大多数 层 使用 Kimi Delta Attention(或 KDA),它 携带 一个 固定 大小 的 递归 状态,而不是 保留 随每个 token 增长 的 传统 键-值 缓存。周期性 的 全注意力 层 保留 对 更广 序列 的 精确 访问。Moonshot AI 表示,这种 混合 结构 支持 1,048,576 token 的上下文窗口,同时 避免 了 全部 使用 全注意力 时 的 内存增长。

Attention Residuals 改变 了 信息 在 层 与 层 之间 的 传递 方式。K3 不再 将 每一层 的 输出 反复 加到 一个 不断 累积 的 残差 流 中,而是 学会 对 早期 的 残差 状态 赋予 不同 的 权重。该 架构 旨在 从 不同 深度 检索 有用 表示,而不是 将 每一项 先前 的 贡献 一视同仁。

Moonshot AI 还 将 模型 的 mixture-of-experts 结构 扩展 到 896 个 路由 专家(routed experts),并为 每个 token 选择 16 个。Stable LatentMoE 在 更窄 的 潜在 维度 中 执行 专家 计算,以 减少 权重 移动 和 通信。名为 Quantile Balancing 的 技术 使用 路由器 分数 的 分布 来 分配 工作,去掉 了 其他 专家 路由 方法 中 使用 的 手动 调参 平衡 参数。

这些 决策 让 Moonshot AI 声称 与 Kimi K2 相比,在 扩展 效率 上 大约 提升 2.5 倍。该 数字 来自 Moonshot AI 的 测量,并 结合 了 架构、训练 和 数据 的 变化,而 未 将 任一 单一 技术 的 贡献 单独 划分。

K3 表面 上 的 效率 也 有 一个 硬 性 的 基础设施 下限。Moonshot AI 建议 部署 至少 使用 64 个 加速器 以 实现 高 带宽 通信。vLLM 的部署指南 表示,服务 该 模型 至少 需要 一个 八 GPU 的 B300 或 GB300 NVL72 节点,同时 也 支持 16 个 B200 GPU。尽管 权重 已 公布,但 在 本地 运行 K3 仍 超出 普通 开发者 工作站 的 能力 范围。

第三方 将 单用户 解码 速度 提高 了 三倍

在 16 块 Nvidia GB300 GPU 上,vLLM 测得 K3 在 单用户、未 使用 speculative decoding 的 情况下 达到 118 tokens/秒。加入 Inferact 的 DSpark 草稿后,这一 结果 提升 到 370 tokens/秒,声称 提升 了 3.14 倍。编码及 其他 可预测 任务 的 平均 每步 被 接受 的 草稿 token 为 4.73 个,而 高熵 工作(如 创意 写作)为 2.61 个。

该 测试 测量 的 是 一个 特定 硬件 配置 和 工作负载,而 非 典型 生产 服务 的 成本 或 吞吐量。它 仍 然 说明 了 草稿 模型 为何 重要:发布 一个 前沿 规模 的 检查点 使 开发者 能够 访问 模型 的 能力,但 周边 的 缓存 管理器、通信 内核、草稿 模型 和 调度器 决定 了 是否 有人 能 以 经济 的 方式 提供 该 服务。

Moonshot AI 对 该 提供 服务 的 定价 非常 激进。其 K3 API 对 每百万 已缓存 输入 token 收费 0.30 美元、每百万 未缓存 输入 token 收费 3 美元、每百万 输出 token 收费 15 美元。Moonshot AI 声称 其 解耦 的 Mooncake 推理 系统 在 编码 工作负载 上 的 缓存 命中率 超过 90%,这一 说法 将 使 得 对于 许多 长期 运行 的 agent 会话 来说,最低 的 输入 费率 成为 相关 指标。

该 模型 仍 受 Moonshot AI 所 记录 的 限制 影响。K3 期望 agent 框架 在 多轮 间 保留 其 早期 的 推理 历史,当 该 历史 丢失 时,质量 可能 变得 不稳定。Moonshot AI 还 警告,当 指令 含糊 时,K3 可能 会 采取 意外 行动,并 表示 其 整体 用户 体验 仍 落后 于 Claude Fable 5 和 GPT-5.6 Sol。

TechCrunch 的报道,该 报告 发布 距 Moonshot AI 在 少于 三个月 前 由 Meituan 的 Long-Z Investments 领投 的 融资 回合 中 募集 约 20 亿美元、估值 超过 200 亿美元 大约 相隔 不到 三个月。该 融资 为 Yang 提供 了 在 万亿参数 规模 继续 训练 的 资本。K3 的 发布 显示 了 赌注 的 另一 半:Moonshot AI 正 在 使用 开放 权重 来 招募 基础设施 供应商 和 开发者,承担 分发 其 模型 所 需 的 部分 工程 工作。

Reader comments

Conversation for this story loads after sign-in.