Applied Compute 向 AC2 添加自蒸馏工作流以用于生产代理反馈
该工具使用纠正、工具故障和其他代理痕迹来训练模型,以学习部署后遇到的行为。
By Ryan Merket · Published
Primary source: Applied Compute on X
Why it matters
Applied Compute is turning agent logs into training infrastructure. If AC2 can control regressions, proprietary production feedback could become a durable advantage for enterprise models.

Applied Compute 在 AC2 中新增了原位自蒸馏(on-policy self-distillation)和相关性掩码自蒸馏(relevance-masked self-distillation)原生工作流,为企业 AI 团队提供了一种将生产轨迹和用户纠正转化为模型训练数据的方式,公司在 8 月 4 日在 X 的一条线程 中表示。该发布推进了联合创始人 Yash Patil (@ypatil125)、Rhythm Garg (@rhythmrg) 和 Linden Li (@lindensli) 所做出的核心押注:公司将希望拥有能够学习其内部工作流的模型,而不是无限期依赖通用系统。 (appliedcompute.com)
https://x.com/appliedcompute/status/2084429372128403913
Patil、Garg 和 Li 在 OpenAI 工作后创立了 Applied Compute。Patil 曾参与 Codex 编码工作,而 Garg 和 Li 曾为 OpenAI 的 o1 system card 做出贡献;Garg 还合著了关于使用推理模型进行竞赛编程的 OpenAI 研究。这样的背景使 Applied Compute 围绕训练后(post-training)、强化学习以及在部署后保持专用模型持续改进所需的基础设施来构建。 (theinformation.com)
在模型已生成的轨迹上进行训练
生产代理会创建关于失败的工具调用、重试、被接受的编辑、用户澄清和人工评论的记录。这些记录包含了模型本应如何做的信息,但它们难以被转换为适用于传统强化学习的数值化奖励。Applied Compute 的新 AC2 工作流改为直接在代理已有的轨迹上进行训练。 (appliedcompute.com)
在原位自蒸馏(on-policy self-distillation,或 OPSD)中,学生模型看到原始提示和它自己的回应。使用相同权重的教师版本则在此基础上加入了提示(例如纠正或解释失败的指令)。AC2 随后比较教师和学生在每个 token 上的偏好,并将学生训练成朝向在额外上下文下产生的行为。该方法为定性反馈以及昂贵、有状态或无法多次重放的任务而设计。 (appliedcompute.com)
Applied Compute 的相关性掩码变体(RMSD)将更新范围缩小到被判断与期望纠正有关的 token。教师在措辞、风格和其他与实际错误关系不大的细节上可能与学生不同。RMSD 首先筛选出教师与学生差异较大的 token 位置,然后使用一个语言模型评判器来挑选最与训练相关的位置。AC2 将这些选择与完整的轨迹、插入的提示以及基于 token 的热图一并展示。 (appliedcompute.com)
这种可视性解决了持续学习中的一个实际风险:一次运行可能显示损失在下降,但模型实际上在记忆一个狭窄的数据集或采纳了与目标无关的教师行为。Applied Compute 表示,它已观察到目标行为在大约 10 次训练步骤内得到改善,而不会扩散到运行中使用的示例之外。AC2 的界面旨在让研究人员在训练进行时就检查该类失败,而不是仅依赖汇总评估分数。 (appliedcompute.com)
公开证据仍然受控
Applied Compute 在 5 月 22 日的一份研究报告中介绍了 RMSD,使用了一个刻意的人为任务:训练 Qwen3-4B 在关于热带食物的回答中把 "pineapple" 错拼成 "pinapple"。在该实验中,据公司结果显示,RMSD 在达到目标行为所需的训练步骤数上大约比普通 OPSD 少一半,并且耗时约减少了 5%。与监督微调相比,它在几个无关评估上的性能保持得也更好。 (appliedcompute.com)
该测试展示了该方法是否能在限制对其他方面损害的同时教会一种分布外行为。但它并未证明在广泛的企业部署场景中的性能。Applied Compute 承认,RMSD 在任务间泛化的能力、对评判模型的敏感性以及何时更新教师权重的最佳时机仍是未解决的研究问题。8 月 3 日的产品报告补充了涉及生产轨迹和工具调用纠正的示例,但没有公布针对新 AC2 工作流的客户级别结果。 (appliedcompute.com)
AC2 支持三条路径:从已存的生产转录离线训练、对单次回合进行重采样,或运行一个完整的可重放环境,在该环境中任务在蒸馏前被评分。Applied Compute 表示,通常先从存储的轨迹开始,以衡量现有生产数据带来的收益,然后在持续学习管道中逐步转向重采样和在线训练。 (appliedcompute.com)
Applied Compute 的基础设施押注
该发布将帮助 Applied Compute 在 4 月 8 日以 13 亿美元估值(融资后)获得 8000 万美元融资的论点具体化。此次融资由 Kleiner Perkins 领投,Elad Gil、Lux Capital、Greenoaks、Neo 和 Hanabi 参与。Applied Compute 表示,此轮融资使其总融资额达到 1.6 亿美元。 (appliedcompute.com)
Applied Compute 将 AC2 定位为训练、评估、推理、部署和持续模型改进的一个控制平面。其网站列出了 Microsoft、Nvidia、Handshake、NTT Data、DoorDash、Harvey、Cognition、Mercor 以及若干生物技术公司作为客户或合作方。这些关系使 AC2 面对一大批模型训练、云计算和代理可观测性工具的竞争,而 Applied Compute 的主张则把这些功能与与客户并肩工作的研究人员结合起来。 (appliedcompute.com)
这次自蒸馏的发布针对的是 Applied Compute 向这些客户出售的数据优势。每个已部署的代理都会产生关于公司偏好和操作流程的新证据。AC2 被设计为将这些证据从日志转移到模型权重中,研究人员可以检查哪些行为发生了变化以及更新是否引入了回归。将该循环变成可重复的基础设施,将使生产使用本身成为下一版本模型的输入,而不仅仅是在出现问题后才被审查的记录。 (appliedcompute.com)