Imbue 将 Catalyst 开源,促使 AI 研究代理继续探索竞争性假设
Kanjun Qiu 和 Josh Albrecht 的 AGPL 工具在 nanochat 上击败了一个线性代理,但其计算成本和研究上的局限仍然相当可观。
By Ryan Merket · Published
Primary source: Imbue on X
Why it matters
Catalyst turns verification and competing hypotheses into first-class parts of an AI research workflow. If the approach generalizes beyond nanochat, small research groups could run broader computational searches without surrendering control to a closed agent platform, though token and experiment costs remain a practical constraint.

Imbue 于 7 月 20 日开源了 Catalyst,为研究人员提供了一个开源系统,该系统在代理运行实验、评估结果并搜索更佳解决方案时保留相互竞争的假设。Imbue 在 8 月 7 日的一条线程中再次推送了这项工作,该线程指回了 7 月的发布,而不是宣布新版本。
Catalyst 针对的是 Josh Albrecht 和 Kanjun Qiu 所提出的一个核心问题:AI 代理可以产出有用的工作成果,同时仍然对用户难以检查、重定向或信任。Qiu 在 MIT 学习计算机科学,曾在 MIT Media Lab 工作,并在加入 Sourceress(由 Y Combinator 支持的招聘软件公司)创立团队之前担任 Dropbox 的首席参谋。Albrecht 曾是早期的 Addepar 工程师,创立并出售了一家 3D 注塑软件公司,并与 Qiu 一起构建了 Sourceress。他们在 2021 年创立了 Imbue,基于这样的理念:AI 工具应保持开放、可修改并由其用户控制。
这一起源对 Catalyst 至关重要。该系统不会要求研究人员信任单一代理的推理链。它维护一组解释(population of interpretations),运行候选实验,分支形成替代解释,并将更多资源分配给得分良好的方法。代码在 AGPL-3.0 许可证下可用,因此研究人员可以检查并修改协调整个代理体系的机制。
Evolution as an escape from agent tunnel vision
在 发布时的研究 中,Daniel Mewes (@danielmewes) 描述了线性研究代理中一个反复出现的失败模式。一旦代理决定其主要思路已穷尽,它可能反复测试小的变体,而不是重新考虑将其带入死胡同的前提。Imbue 将这种行为称为“假设崩溃”(hypothesis collapse)。
Catalyst 试图通过“解释线索”(interpretation strands)来防止这种崩溃。每条线索包含代理对证据的工作性解释以及它认为有前途的实验路线图。Catalyst 在这些线索中进行抽样,要求代理提出实验,并执行那些被判断最有可能推进研究的提案。
周期性地,Catalyst 将观察结果整合为更新的理论。有些理论会分支为刻意不同的解释。候选线索随后根据它们产生的解决方案的表现以及其提出的研究路径的新颖性获得评分。独立的审查代理会寻找奖励滥用、规范违规以及被提议结果未通过其验证器的证据。
该方法将熟悉的语言模型代理作为组件。Catalyst 的贡献在于围绕这些代理的搜索与评估流程。其 仓库支持 Claude Code、Gemini CLI、Antigravity CLI 和 Codex CLI,用户需提供自己的模型访问并直接向服务提供商付费。
The nanochat result comes with a narrow denominator
Imbue 在 nanochat 上展示了 Catalyst,nanochat 是 Andrej Karpathy 的 AutoResearch 使用的小型 transformer 训练项目。Karpathy(他在 2026 年早些时候加入了 Anthropic)围绕一个编码代理设计了 AutoResearch,该代理反复改变训练设置并保留那些能提高测量结果的修改。
测试给每次实验在一块 H100 GPU 上五分钟的时间。代理可以修改 nanochat 的架构、训练配方和超参数,同时一个验证器以 bits per byte 衡量验证性能。Imbue 表示,Catalyst 的进化工作流在 340 次实验后达到了 val_bpb 分数 0.9361,并且在停止运行时尚未见到平台期。
Imbue 将这一改进描述为比常规 AutoResearch 代理前进了三倍。这一数字来自于单一的 nanochat 优化设置,而不是跨不同模型或研究问题的基准。Imbue 还将 Catalyst 与 Recursive Superintelligence 的工作进行了比较,尽管比较需要根据挂钟时间估算 Recursive 的实验次数。Recursive 在运行期间从 H100 切换到了 B200,而 Imbue 只使用了 H100 的那部分时间。Imbue 承认 Recursive 可能更高效地达到了可比的分数。
这些警告将论断缩小为一个有用且可辩护的结论:在被测试的线性代理停滞后,进化搜索仍然持续发现改进。该结果并不能证明 Catalyst 在所有科学领域都会优于其他研究系统。
Open code leaves a substantial compute bill
Catalyst 最适合通过代码即可测试答案的问题。其仓库建议使用窄的优化目标、可复现的计算现象和明确的验证脚本。Imbue 表示,目前的实现不适合物理实验、目标不明确的一般工程项目以及超出底层模型能力的问题。
Catalyst 仓库 将单次实验的默认限制设为 30 分钟,用户可以更改,并指出进化工作流经常调用超过 100 个子代理。其成本表估算,使用 Gemini 3.5 Flash 运行一次 Develop Theory evolution run 大约花费 200 美元,使用 Claude Opus 4.8 则约为 1,000 美元。估算 Solve Verifiable Goal evolution run 大约在使用 Claude Opus 4.8 时花费 500 美元左右。Imbue 还表示,在典型的 Develop Theory 工作流中,审查与评分大约消耗了 65% 的 token。这些 API 估算不包括运行实验所使用的计算资源。
这种分配显示了 Qiu 和 Albrecht 把赌注押在何处。更好的研究代理将需要花费大量预算用于挑战、排名和修订想法,而不是生成一个单一的润色答案。验证成为核心工作流的一部分,而不是代理完成后进行的最终检查。
Catalyst 更具抱负的理论工作流遵循相同原则。在一项配套实验中,Imbue 使用候选解释的群体、对抗性审查者和反驳尝试来研究神经网络训练现象。Imbue 警告称,幻觉、数据伪造、缺失引用和奖励滥用仍未解决。人工研究人员仍需监控工作并验证其结论。
Catalyst follows Imbue's 2026 reset
Catalyst 也反映了 Imbue 内部的组织转变。在一篇关于重置的 1 月 30 日账述 中,Albrecht 写道,在推动 Imbue 加速发布其并行编码工作空间 Sculptor 的紧张冲刺后,他和 Qiu 感到心灰意冷。他表示,他们希望 Imbue 转向更小型的公开项目,并赋予单个项目负责人对其发布内容的广泛控制权。
Catalyst 将该计划具体化。它是一个可检查的研究项目,具有命名贡献者、可复现的实验,并邀请外部研究人员贡献模板。Catalyst 仓库将 Daniel Mewes、Catherine Kim 和 Evan Ryan Gunter 列为贡献者。
Imbue 有足够的资金以不将每次发布立即变成付费产品的方式推进该模型。2023 年,Imbue 宣布完成 2 亿美元的 B 轮融资,估值超过 10 亿美元,参与方包括 Astera Institute、Nvidia、Cruise 联合创始人 Kyle Vogt、Notion 联合创始人 Simon Last 等投资者。Imbue 此后又 获得了来自 Amazon 的 Alexa Fund 和 Eric Schmidt 的 1,200 万美元追加投资。
相对于那笔资本,Catalyst 在技术上是一个较为狭窄的发布。其重要性在于 Qiu 和 Albrecht 正在试验的运营模式:开源研究软件,让人类指定目标、检查搜索过程并挑战代理的结论。nanochat 的结果为该论点提供了早期的数据点。更广泛的研究使用将决定竞争性假设能否帮助代理产生在受控优化任务之外也能经得起审查的发现。