Wafer 表示 AMD 的 MI355X 在 Kimi K3 的成本效率方面优于 Nvidia B300

Wafer 报告称,一台配备八块 GPU 的 MI355X 节点每秒处理 952 个标记(tokens),并认为 AMD 的每块 GPU 288 GB 内存可以降低开源模型的推理成本。

By · Published

Primary source: Wafer

Why it matters

Kimi K3's size turns GPU memory into a deployment constraint. Wafer's self-reported benchmark shows how software tuning and larger HBM capacity could make AMD economical for frontier-scale open models, even when Nvidia retains the raw-speed lead.

Illustration of an AMD MI355X eight-GPU node in a server rack, highlighting the GPUs and 288 GB memory per GPU.

Wafer, founded by Emilio Andere (@gpuemi) and Steven Arellano (@gpusteve), 表示它在八块 AMD MI355X GPU 上运行 Kimi K3 时,凭借内存容量和两项软件修复,在每美元性能上优于一套 Nvidia B300 系统,从而缩小了 AMD 在推理方面的差距。

这家旧金山的 AI 基础设施提供商报告称,在峰值聚合吞吐量上达到了每秒 952 个输出 token,在单流上达到了每秒 118 个 token。Wafer 在其技术团队成员 Ian Ye 撰写的 July 31st technical post 中披露了这些结果。

Wafer 的绝对吞吐量仍低于 B300 配置,同一测试中 B300 达到了每秒 1,568 个 token。经济结果则相反:Wafer 计算得出 MI355X 的每美元吞吐量为每秒 48 个 token,而 B300 为每秒 33 个,两个节点的 B200 部署为每秒 7 个。

这些数字基于 Wafer 假定的小时租用价格:每块 MI355X GPU 为 2.50 美元,B300 为 6 美元,B200 为 4.25 美元。Wafer 使用其自身的测试设置生成了这些数据。

内存决定硬件选择

Kimi K3's technical report 描述的是一款 mixture-of-experts 模型,总参数量为 2.8 万亿,活跃参数为 1,040 亿,且拥有 100 万 token 的上下文窗口。Wafer 估算,模型权重在为推理过程中使用的键值缓存分配内存之前,就需要超过 1.5 TB 的 GPU 内存。

这个规模创造了 Wafer 所利用的机会。一块 AMD MI355X 搭载 288 GB 的 HBM3E,使得八卡节点大约拥有 2.3 TB 的高带宽内存。Wafer 表示,同一模型加上 100 万 token 缓存不会适配在单个八卡 B200 节点上,迫使其 B200 测试在两个节点的 16 块 GPU 上运行。

这些配置很重要。Wafer 的 B200 部署在解码路径上承担了跨节点通信的延迟成本,而 MI355X 和 B300 系统都保持在单节点内。Wafer 报告称,整个 16 卡 B200 部署的聚合吞吐量为每秒 498 个 token,大约每个节点 249 个。

这使得与 B200 的比较在结构上处于不利地位。它也体现了 Wafer 希望客户注意到的实际约束:一块具有足够内存的 GPU 可以避免名义上更快的加速器所需的跨节点协调。随着开源权重模型的增长,内存容量在原始计算性能进入考量之前,可能就已决定了推理的部署架构。

Arellano 在 X 上写道,Wafer 在 MI355X 上实现了 “3.8x higher throughput and 71% lower cost”,与其 B200 配置相比。这个吞吐量倍数是按节点测量的,而成本百分比则基于 Wafer 列出的小时租用假设。

Steven Arellano on X

两个小修复带来了大部分提升

Wafer 表示,Kimi K3 可以在 AMD 的 ROCm 软件上运行,而无需从头移植,但最初的部署留下了大量未被利用的性能。

Wafer 首先添加了基于 RadixArk's Kimi-K3-DSpark 的推测解码,该外部草稿模型设计用于提出若干个 token,Kimi K3 可以一起验证这些候选。CUDA 版本可以直接工作。在 ROCm 上,SGLang 的 accept-sampling verifier 中缺少 top_k_renorm_prob 定义,导致调度器失败。

Wafer 在 PyTorch 中实现了该操作:选择概率最高的 token,对其余进行掩码,并对保留的值重新缩放。Wafer 表示,此修复将单流性能大约提升了 2.2 倍,在中等负载下将每流性能提升约 1.7 倍,并将峰值聚合吞吐量提高了 18%。

第二个问题出现在 prefill 阶段,即模型在产生第一个输出 token 之前处理用户输入的阶段。Wafer 最初测得 MI355X 在 172,000 token 的冷启动 prefill 上大约需要 51 秒,而 B300 大约需要 23 秒。

Wafer 将大部分延迟追踪到注意力核(attention kernel)形状不匹配。Kimi K3 在跨八块 GPU 的张量并行下每个 rank 产生 12 个 attention head,而 AMD 更快的 AITER 路径支持 4、8 或 16 的倍数。Wafer 将 head 数从 12 填充到 16,运行更快的核,然后丢弃多出的输出。

Wafer 表示,此更改将稳态 prefill 性能从大约每秒 4,000–7,000 个 token 提高到约每秒 13,000 个,并改善了首个 token 出现前的时间。

围绕 Wafer 创业主张构建的基准

Andere 和 Arellano 在 University of Chicago 的第一年相识,成为室友,并围绕有限的性能工程师数量限制了 AI 硬件利用效率这一想法创办了 Wafer。Andere 学习数学,在 UChicago 从事机器学习安全研究,并在 Argonne National Laboratory 做气象模型相关工作。Arellano 学习计算机科学,并在 Google、Two Sigma 和 Sei Labs 从事高性能计算与 AI 基础设施工作。

Wafer 现在主打能够分析工作负载并在模型、推理引擎、核函数和硬件配置之间搜索的软体代理。 Y Combinator lists Wafer 将 Wafer 列为 2025 年夏季公司,团队在旧金山有七名员工。

MI355X 的工作直接展示了创始人所宣称的软件优化能够使替代加速器在经济上对高要求模型具有竞争力。这也是对 Wafer 的无服务器 API 和专用推理部署的销售论据:客户可以将模型和工作负载交给 Wafer,而不是事先在某个芯片供应商上做出承诺。

Wafer raised a $4 million seed round on April 14th, 2026,由 Fifty Years 领投,Liquid 2 和 Y Combinator 参与。本次融资公告将 Wafer 的目标表述为通过自动化传统上由少数内核与系统专家执行的工作来最大化 “intelligence per watt”。

Kimi K3 为这一主张提供了有力的压力测试。其体量有利于 AMD 的 288 GB 内存设计,而 Wafer 遇到的软件问题足够狭窄,可以在不编写新的自定义核函数的情况下修复。这样的组合对 Wafer 和 AMD 都有利:AMD 获得了其硬件能够服务于前沿规模开源模型的证据,Wafer 则获得了一个具体示例,说明为什么推理买家可能需要在芯片供应商之间进行优化。

该结果并未证明 MI355X 是更快的 GPU。Wafer 自己的 B300 测试在聚合吞吐量上高出 65%,且单流更快。Wafer 的发现更狭窄但具有商业相关性:在其配置和租用价格下,一个 MI355X 节点以更低的单位吞吐成本处理 Kimi K3。

Reader comments

Conversation for this story loads after sign-in.