Pipe Network 发布了适用于 512GB Mac Studios 的 350GB Kimi K3 构建
经过剪枝的 MLX 模型可以放入统一内存,但 Pipe 报告每秒 0.20 个标记,并警告质量会下降。
By Ryan Merket · Published
Primary source: Pipe Network on X
Why it matters
Pipe made a 1.56TB frontier model loadable on one high-memory Mac, exposing the harder constraint behind open weights: usable local inference still demands severe compromises.

David Rhodus (@DavidRhodus) 和 Pipe Network 发布了一个 Apple MLX 移植,将 Moonshot AI 的 2.8万亿参数的 Kimi K3 从磁盘上的大约 1.56TB 缩减到仅 350GB,使得模型的一个经过大幅剪枝的版本可以在配备 512GB 统一内存的 Mac Studio 上加载。
Pipe 在 7 月 28 日于 X 的一个线程中宣布了该发布,这比 Moonshot 发布 Kimi K3 的权重和技术报告晚一天。GitHub 仓库 包含一个 MLX 实现、一个流式检查点转换器、校准工具以及用于对 K3 的 mixture-of-experts 架构进行剪枝的脚本。Pipe 还将三个转换后的检查点上传到了 Hugging Face。
此次发布更像是一个系统工程项目,而非一个实用的本地聊天机器人。Pipe 发布的最快构建大约每秒生成 0.20 个 token,或大约每五秒一个 token。其更大的变体运行在每秒 0.14 到 0.16 个 token。Pipe 将这三者都描述为非交互式,并表示剪枝会造成明显退化,包括重复输出和回复偏离提示(prompt)。
将 896 个专家裁剪至 179 个
Kimi K3 是一款 mixture-of-experts 模型,总参数量为 2.8 万亿,活跃参数为 1040 亿。Moonshot 的架构包含 896 个路由专家,每个 token 选择 16 个,此外还有两个共享专家。根据 Moonshot 的技术报告,它还结合了原生图像支持和约 100 万 token 的上下文窗口。
Pipe 的最小检查点保留了这 896 个路由专家中的 179 个,减少了 80%。由此产生的 REAP80 构建 占用 350GB。一个 451GB 的版本保留了 242 个专家,而另一个 451GB 的检查点使用了在校准集上偏重中文和编程代码的权重。
转换器对 K3 进行增量处理,因为在转换过程中加载完整检查点会超出 Mac 可用内存。Pipe 表示未压缩的 BF16 表示将占用约 5.6TB。K3 的路由专家已经使用了 Moonshot 的 MXFP4 编码,MLX 可以在不进行另一次有损量化的情况下保留该编码。因此,大部分的体积减少来自于删除专家,而不是压缩保留下来的专家。
这种权衡是显著的。451GB 模型卡 表示该检查点在一台 512 GiB 的 M3 Ultra 上 66 秒内完成加载,并以大约每秒 0.16 个 token 的速度生成代码、英文和中文样例。Pipe 警告称,剪枝可能产生列表式的续写、重复以及较弱的一般语言表现,即使代码补全在结构上仍然连贯。
Pipe 的文档之间也存在自相矛盾。单个 Hugging Face 卡片报告了在 512 GiB M3 Ultra 上成功生成并测得的速度。GitHub README 中的一个名为 “Reality check” 的单独部分却表示没有发布的层级能在单台 Apple Silicon 机器上运行,且这些工件从未产生过 token。在同一 README 的其他地方,Pipe 又列出了带有测量吞吐量的 350GB 和 451GB 构建。Hugging Face 卡片包含了更具体的测试配置和输出样例,但这种矛盾使得独立复现变得至关重要。
Rhodus 将一家 CDN 公司转向 AI 基础设施
Rhodus 通过 Permissionless Labs 构建了 Pipe,Permissionless Labs 现在将自己描述为一家提供推理、存储和微调的 AI 基础设施实验室。这一定位较 Pipe 最初作为一个使用独立运营节点将数据更靠近用户的去中心化内容分发网络(CDN)的定位,是一次显著的扩展。
在创办 Pipe 之前,Rhodus 在流媒体和数据基础设施领域工作了大约二十年。他曾任 Volar Video 的 CTO,并且是 Elemental Technologies(被 Amazon Web Services 收购的视频基础设施提供商)的早期员工。随后他还在 ConsenSys 工作过,以上信息来自 Multicoin Capital 对其投资的说明。
2024 年 9 月,Permissionless Labs 完成了一轮由 Multicoin 领投的 1000 万美元 A 轮融资,参与方包括 Robot Ventures、Solana Ventures、Solana 联合创始人 Anatoly Yakovenko 和 Meltem Demirors。该笔融资当时被描述为用于扩展 Pipe 的 CDN 网络、招聘工程师并启动其测试网的资金。
对 Kimi 的移植显示了 Rhodus 将同样的基本赌注应用于 AI:大型模型正变得可下载,而在移动、存储和服务它们的权重方面仍然是一个基础设施问题。将 K3 缩小以适配苹果最大的统一内存配置跨越了一个技术门槛。在每秒 0.20 个 token 的速度且移除了大部分路由专家的情况下,这仍然是为那些愿意以速度和模型质量为代价换取对运行机器的控制的开发者准备的一个实验。