UCSB 和 LinkedIn 的研究人员训练 AI 代理以预测它们自己的工具调用
该方法在五个基准上提高了 exact-match 准确率,同时重用同一个模型及其 KV 缓存,但现实世界的延迟收益仍未得到证实。
By Ryan Merket · Published
Primary source: arXiv
Why it matters
Tool latency keeps multi-step agents from feeling interactive. Self-speculation could hide part of that wait without serving a second model, but production gains will depend on exact-match rates, API costs and safeguards for state-changing actions.

Jiabao Ji, Yujian Liu and Li An,三位在 LinkedIn 实习的 UC Santa Barbara 研究人员,训练了 AI 代理去预测并预先执行它们自己的下一个工具调用,尝试消除依赖搜索引擎、数据库和外部 API 的系统中日益增长的延迟来源。
研究者在一篇 7 月 28 日的 arXiv 论文 中描述了该方法,论文合作者还包括 LinkedIn 的研究人员 Rohit Jain、Gungor Polatkan 和 Siyu Zhu 以及 UCSB 计算机科学教授 Shiyu Chang。DAIR.AI 在 X 上对这项研究进行了报道,时间为 7 月 30 日。
Ji 是由 Chang 指导的 UCSB 博士生,读博第四年。他之前的研究实习包括 Adobe Research、Meta 的 GenAI Llama 小组和 Apple AI/ML,随后在 2026 年于 LinkedIn 的 CoreAI 小组工作。Liu 同样是由 Chang 指导的读博第四年学生,之前在 Adobe Research、MIT-IBM Watson AI Lab 和 AMD GenAI 工作。他们的新论文超越了训练代理正确选择工具的工作,转而关注何时可以开始这些调用。
一个模型,两项任务
使用工具的代理在生成文本与等待外部系统之间交替。一次搜索请求、数据库查找或子代理可能比模型自身的 token 生成耗时更久,这会让昂贵的推理硬件处于空闲状态,并使本来能力强的代理显得缓慢。
投机性工具执行(speculative tool execution)试图填补这一空档。当代理继续推理时,一个投机者(speculator)预测下一个结构化调用,包括其工具名和参数,并提前发起请求。如果预测与代理最终产生的调用完全一致,系统便可复用结果。若不匹配,则必须丢弃投机工作。
以往的方法通常将该预测任务交给较小的草稿模型(draft model),或从缓存的痕迹中检索出可能的动作。UCSB 与 LinkedIn 的研究者认为这些系统会产生“投机者—代理差距”(speculator-agent gap):草稿模型近似代理可能执行的操作,但无法精确匹配已部署代理的策略。额外的模型在服务时还需要自己的权重和 KV 缓存。
他们的自我投机(self-speculating)设计将两项任务都交给同一个语言模型。在代理模式下,模型像往常一样推理并调用工具;在投机者模式下,它接收一个部分轨迹以及一个简短后缀,要求其预测下一个结构化调用。两种模式共享模型参数,并可以重用相同的前缀 KV 缓存。
研究人员通过交替的强化学习更新训练这两种模式。每一批代理 rollout 都会产生当前模型实际选择的调用的新示例。这些调用随后成为其投机训练的目标。最终的训练计划使用四次代理更新随后跟随八次投机者更新,且每当训练模式切换时会重置优化器状态。
这种分离至关重要。一对一的更新计划在三项用于消融的搜索基准上平均得到 31.8 的 Hit@1 和 10.3 的任务成功率。四对八的计划在相同迭代预算下达到 55.2 的 Hit@1 和 26.1 的任务成功率。
基准提升
研究者使用 40 亿参数的 Qwen3 和 Qwen3.5 模型测试了该方法。评估涵盖了用于搜索的 HotpotQA、MuSiQue 和 BrowseComp-Plus,以及用于会话 API 使用的 tau-bench 的航空和零售领域。
对于 Qwen3-4B,平均下一个调用的 Hit@1 从监督微调后的 44.1 提升到联合强化学习阶段后的 61.2。Qwen3.5-4B 则从 48.9 提升到 66.3。Hit@1 成功要求工具名和完整参数字典都精确匹配。
报告的下游任务成功率平均值也保持稳定或略有上升。Qwen3-4B 从监督微调后的 26.6 增至强化学习后的 27.7,而 Qwen3.5-4B 从 49.2 增至 50.6。这些平均值结合了基线难度显著不同的任务,因此表明在测试设置中,添加的投机目标并未抹除代理已有的能力。
一个早期的现成对比展示了研究者为何拒绝使用独立的草稿模型。在 MuSiQue 上,Qwen3-4B 自己预测下一个调用得到 25.3 的 Hit@1,同时使用了 8.70 GB 的 GPU 内存和 8.3 秒的投机墙钟时间。一个 Qwen3-1.7B 的外部投机者达到 14.7 的 Hit@1,而组合设置则消耗了 12.76 GB 和 33.1 秒。测试在单张 Nvidia H100 上运行并使用了显式的模型切换,因此这些测量描述的是论文中的服务设置,而非普适的生产成本。
声称的边界
结果证明了自我投机配置在预测准确率和服务开销上更有优势。论文并未报告端到端的生产部署,也没有展示在真实工具并行运行时训练模型能减少多少用户可见的延迟。
训练后大约有六到七成的预测是精确匹配的。剩余的投机调用无法被复用,使得运营者需在浪费的 API 请求与计算开销和正确猜测带来的延迟节省之间权衡。
安全性进一步缩小了可立即应用的场景。错误的投机性网页搜索可以被丢弃;但错误的订单、数据库更新或外发消息可能在代理尚未提交该动作前就改变外部状态。作者将当前案例限制为只读操作,并建议对会改变状态的工具使用演练模式、回滚机制或人工确认。
实验使用了 4B 规模模型和两类任务。代码执行、浏览器控制、长时运行的工作流、多代理系统以及更大型的前沿模型仍在评估范围之外。即便在该边界内,这项工作也为构建代理的人提供了一个实用的设计选择:已部署的策略可能比为模仿它而训练的更便宜模型更能准确预测其下一步动作。