Composio 的 Kimi K3 测试发现代理运行框架之间存在 6 倍的令牌差距

在28个任务中,Kimi Code、Hermes 和 Claude Code 的完成率相近,而中位 token 使用量在61,000到340,000之间。

By · Published

Primary source: Composio on X

Why it matters

Agent economics depend on orchestration as well as model pricing. A poorly matched harness can multiply token use while producing nearly the same completion rate.

The quantitative efficiency gap in AI token consumption within different agent frameworks (macro photograph — extreme close-up of a physical object, razor-thin focus plane, visible material texture)

Composio, the AI-agent infrastructure company founded by Soham Ganatra (@GanatraSoham) and Karan Vaidya (@KaranVaidya6), said Wednesday that Moonshot AI's Kimi K3 consumed nearly six times as many tokens in Claude Code as it did in Kimi Code while completing the same set of agent tasks at a similar success rate.

公司进行的测试 将 Kimi K3 在 28 个相同任务中依次运行于 Claude Code、Nous Research 的 Hermes 和 Kimi Code。Kimi Code 完成了 22 项,Hermes 完成了 21 项,Claude Code 完成了 20 项。完成率的差距很小,但令牌消耗差距很大:中位任务在 Kimi Code 中使用了 61,000 个令牌,Hermes 为 67,000,Claude Code 为 340,000。Composio 还报告称,个别任务在不同 harness 之间的令牌消耗最多可相差 30 倍。 (x.com)

根据 Composio 的数据,Hermes 的中位完成时间最短,为 179 秒。Kimi Code 为 297 秒,而 Claude Code 为 348 秒。这些数字使得 Hermes 在这一小规模测试中成为速度领先者,Kimi Code 则是令牌效率领先者。

这些结果很有意义,因为开发者通常使用完成率和基准分数来比较代理模型。Composio 的测试在保持模型不变的情况下改变了其周围的软件:系统提示、工具循环、上下文管理以及其他统称为 harness 的编排选择。在此运行中,这些选择带来的经济差异比成功率差距更大。

Kimi warns that harness compatibility matters

Moonshot 的 Kimi K3 技术博客 提供了一个重要的限定说明。K3 在训练时被设计为保留其思考历史,Moonshot 警告称,当某个 harness 未能正确返回该历史时,性能可能变得不稳定。Moonshot 建议使用已验证兼容的 harness(例如 Kimi Code),并警告不要在会话期间切换模型。 (kimi.com)

这使得 Composio 的结果更像是在测试模型与 harness 的配对,而非对 Claude Code 的普遍评判。围绕某一模型家族的上下文和推理行为进行优化的 harness,在与另一类模型配合使用时可能会带来显著的开销。Moonshot 自己在 K3 发布材料的不同基准测试中也使用了不同的 harness,包括 Kimi Code、Claude Code 和 Codex。

令牌差距仍然带来直接成本。Moonshot 在缓存未命中时将 K3 API 输入定价为每百万令牌 3 美元,缓存命中时为每百万令牌 0.30 美元,输出定价为每百万令牌 15 美元。实际账单取决于输入-输出的组合和缓存情况,但一个反复重新加载上下文或执行不必要工具循环步骤的代理,可能会抹去选择更便宜模型带来的节省。 (kimi.com)

Composio 的 28 项任务样本具有指导性,且该基准来自于在编排层有商业利益的厂商。Composio 出售用于将代理连接到超过 1,000 种工具的基础设施,包括认证、工具执行和上下文管理。其得出“开发者在替换模型之前应检查 harness”的结论,强化了 Ganatra 和 Vaidya 正在构建的产品类别。 (composio.dev)

Composio is betting on the layer around the model

Ganatra 对该层的兴趣早在当前编码代理市场形成之前就已开始。他在一篇 2025 年的采访 中表示,在担任反欺诈与风险初创公司 Bureau 的创始工程师、后来担任工程与产品经理时,他遇到了维护软件集成的成本问题。他在 2023 年 4 月或 5 月左右离职,决定创建 Composio,因为他认为改进代码生成模型可以自动化部分集成工作。 (pmf.show)

Vaidya,Composio 的 CTO,在他的 个人网站 上列出了 Google 和 Rubrik 等他的过往经历。根据该校的 校友办,两位创始人均于 2017 年毕业于 IIT Bombay 的计算机科学专业。 (acr.iitbombay.org)

2025 年 7 月 22 日,Composio 宣布完成由 Lightspeed Venture Partners 领投的 2,500 万美元 A 轮融资,使其 reported 总融资达到 2,900 万美元。本轮投资者包括 Vercel 首席执行官 Guillermo Rauch、HubSpot 联合创始人 Dharmesh Shah、SV Angel、Operator Partners、Elevation Capital 和 Together Fund。Composio 当时表示其平台服务超过 100,000 名开发者以及 200 家初创公司和企业;这些数字仍为公司自报数据。 (prnewswire.com)

Kimi K3 为 Composio 提供了对其所押注方向的及时示范。前沿模型越来越多地带有对思考历史、上下文压缩、工具格式和推理控制的特定要求。harness 决定了这些要求是成为高效执行,还是成为昂贵的循环。Composio 的测试给出了该实现风险的一个量化:相似的任务完成情况可能掩盖中位令牌使用量六倍的差异。

Reader comments

Conversation for this story loads after sign-in.