Coral's AgentRadio 将编码代理的准确率提高到 62%,但成本增加了六倍。

在一个代码库基准测试中,四个 Opus 4.6 代理击败了一个 Opus 4.8 代理,尽管一个更新的模型已经略微超越了这一结果。

By · Published

Primary source: VentureBeat

Why it matters

AgentRadio shows that orchestration can extract a model-generation-sized gain from existing coding agents. The commercial tradeoff is a roughly sixfold increase in inference cost.

Multiple AI coding agents collaborating on a central codebase (Courtroom-sketch pastel drawing — loose urgent strokes on toned paper with soft grain)

Caelum ForderPeter Carroll,Coral AI Labs 的创始人,提供了证据表明围绕 AI 模型的架构可能与升级模型本身同样重要。他们的研究人员的 AgentRadio 论文,于 7 月 30 日发表,报告称当四个运行 Anthropic 的 Opus 4.6 的 Claude Code 代理在执行过程中可以交换发现时,它们解决了一个高要求的代码库理解基准测试中的 62.1%。研究人员的运行中,单个 Opus 4.6 代理解决了 32.3% 的任务,而使用较新 Opus 4.8 的单个代理在 Scale AI 的公共排行榜上得分为 57.2%。

这一比较比 8 月 7 日 VentureBeat 报道该研究 后流传的头条结果要窄得多。AgentRadio 并未证明 Opus 4.6 普遍优于 Opus 4.8,也未证明四代理系统始终优于更新的模型。它在 124 个代码理解任务上击败了一个 Claude Code + Opus 4.8 的配置。Scale 的 当前排行榜 已经列出使用 Opus 5 的单个 Claude Code 代理得分为 63.17%,略高于 AgentRadio 的 62.1%。

这种快速的反转强化了 Coral 的论点。模型发布可以在几天内抹去基准领先优势。协调软件仍能从企业已经使用的模型中生成巨大增益,尤其是在需要跨多文件、工具和执行步骤的工作上。代价同样明确:AgentRadio 的四代理 Opus 4.6 配置每个任务平均花费 19.45 美元,而单代理为 2.96 美元。

Forder 是 Coral 的技术创始人兼 CTO。Coral 的当前团队页面 表示他此前在 IBM Watson 构建 AI 基础设施,在 Conjecture 从事 AI 安全工作,并曾作为创始工程师在多代理框架开发者 CAMEL-AI 工作。Coral 的 CEO Carroll 表示他曾自筹资金将一家游戏工作室发展到 30 名员工,随后为 Coral 的早期开发提供资金并围绕 Forder 在代理协调方面的工作组建业务。首席研究员 Xinxing Ren,Brunel University London 的博士毕业生且曾为 CAMEL-AI 做出贡献,是该论文七位作者之一,其他作者包括 Qianbo Zang、Ziyan Wang、Forder、Suman Deb、Carroll 和 Zekun Guo。

AgentRadio 改变了什么

AgentRadio 解决了一个看似平凡但后果重大的系统问题:执行任务的代理通常无法同时监控实时对话。现有的多代理设计常常让多个代理沿不同路径独立工作并在后期合并答案,或要求每个代理在交换信息前在同步检查点停止。两种设计都会延迟那些本可以在执行过程中改变正在进行工作的发现。

Coral 的系统在现有的编码代理框架上增加了三种通信操作:create_threadsend_messagewait_for_mention。代理可以打开一个命名对话,发送非阻塞消息,并将提及监视器作为后台操作系统进程运行。传入消息会在代理的执行步骤之间出现,而不会停止正在进行的命令。

开源实现,在 Apache 2.0 下发布,不需要对 Claude Code 本身进行更改。每个代理通过薄壳脚本与独立的消息服务器通信。研究人员在每个基准容器内运行了一个服务器和四个 Claude Code 代理,使用 Modal 和 Harbor 来管理作业。

Coral 将这些原语包装进一个五阶段的操作流程。所有四个代理首先独立检查代码仓库,然后协商如何划分问题,接着并行执行各自的调查,审查彼此的证据,并由一名指定代理组装并批准最终答案。在执行过程中,代理被指示发布那些会影响其他代理任务分配、与已达成的计划相矛盾或暴露死胡同的发现。

普通的多代理委派与 AgentRadio 的区别就在那个执行阶段。在 Coral 的阻塞配置下,代理必须在前台步骤中等待消息,因此倾向于在工作时不监听。在被动感知下,监视器在后台保持活动,并在下一个步骤边界提供消息。

协商产生了最大的增益

Coral 的实验将架构分层,而不是仅比较最终系统与单代理。

单一 Opus 4.6 代理解决了 124 个任务中的 40 个,或 32.3%。四代理在基本任务划分下解决了 49 个任务,将准确率提升到 39.5%。加入联合规划和交叉审查后,结果提高到 64 个任务,或 51.6%。将消息接收移到后台则产生了最终的 77 个任务结果,或 62.1%。

这个进阶很重要,因为它表明增加代理是效果最弱的干预。基本任务划分带来了 7.2 个百分点的提升,协商增加了 12.1 个百分点,被动感知又提供了 10.5 个百分点。四代理的结果来自一个结构化的流程,该流程强制代理在工作仍在进行时协商任务分配、暴露证据并修订工作。

研究人员在相同的 Claude Code 框架内使用 DeepSeek V4 Pro 重复了这些架构变化。单代理基线得分为 29%。划分将其提高到 31.4%,协商达到 39.5%,而 AgentRadio 最终为 50.8%。在两类模型上出现的类似进展支持 Coral 的主张:增益来自协调层,而不是 Opus 4.6 的孤立特性。

Coral 还对被动感知步骤进行了配对显著性检验。使用 Opus 4.6 时,后台通信将此前失败的 15 个任务变为通过,同时失去了阻塞系统曾通过的 2 个任务。DeepSeek 对应为 17 个胜利和 3 个损失。报告的 p 值分别为 0.0023 和 0.0026。

这些损失很重要。消息可能会分散代理对富有成效调查的注意力,传播错误结论,或将注意力重定向到队友较弱的假设上。即便传递机制按设计工作,代理间通信也会引入另一种上下文污染来源。

经济性比基准更难平衡

AgentRadio 的最强结果每个任务的成本约为单个 Opus 4.6 运行的 6.6 倍。基本划分平均每个任务花费 5.38 美元,而加入协商将账单提高到 15.59 美元。被动感知将其带到 19.45 美元。

Coral 通过对单代理进行六次独立运行并保留最佳答案来测试改进是否仅仅来自于消耗更多令牌。该方法每个任务花费 17.76 美元,接近四代理系统的预算,解决了 37.9% 的任务。AgentRadio 以多花 1.69 美元的代价达到了 62.1%。在 DeepSeek 实验中,六次独立运行花费 2.52 美元并得分 31.4%,而 AgentRadio 花费 2.46 美元并得分 50.8%。

该对照支持了一个有用的区分:推理量与有组织的推理。重复相同过程会产生额外尝试。AgentRadio 将预算分配到独立上下文,然后使用协商和实时消息在最终答案固定前结合发现。

企业买家仍需为将单个代码库问题的成本从大约 3 美元提高到近 20 美元进行合理化计算。当一个准确答案能避免数小时的工程工作、生产事故或错误迁移时,这种计算变得合理;但对于日常问题、高量自动化以及可以由廉价人工验证答案的工作流来说,则变得困难。

Anthropic 在 2025 年描述其自身的 多代理研究系统 时得出了类似的经济结论。Anthropic 表示多代理系统使用的令牌量大约是普通聊天交互的 15 倍,并且在有价值且高度可并行化的任务上效果最佳。Anthropic 还指出编码是一个困难的案例,因为软件任务包含依赖关系,代理在实时协调方面存在困难。AgentRadio 是直接试图放宽该约束,而不是消除根本成本。

基准奖励详尽理解

SWE-Atlas Codebase QnA 测量代理在编辑生产仓库之前是否能理解不熟悉的生产代码库。它的 124 个任务覆盖了 11 个仓库,使用 Go、Python、C 和 TypeScript 编写。问题涵盖架构、根本原因分析、工程师入职、安全和 API 行为。

静态代码搜索不足以应对。代理会收到一个在 Docker 容器中的仓库,可能需要编译它、执行命令、重现行为并跨多个文件追踪路径。每个答案都要根据平均 12.3 条事实性标准进行评分。只有当每一项标准都通过时,任务才算解决,而修改源文件会触发自动失败。

这一设计使 SWE-Atlas 成为比以生成补丁为中心的传统编码评估更能考察长期调查能力的测试。它仍然是包含其自身评分选择的一个基准。AgentRadio 实验使用 Claude Opus 4.5 作为评判者,在所有配置中固定不变,并对每个完整的 124 任务配置运行了一次。Coral 则在一个 30 任务的子集上将四个主要的 Opus 4.6 配置各重复运行了三次。AgentRadio 在那里平均为 64.4%,标准差为两个百分点,其最弱的一次运行仍然超过了其他配置的最好一次运行。

公开排行榜也说明了参考点变化之快。论文将 AgentRadio 与 Opus 4.8 进行比较,因为那是研究者引用的最强的单代理条目。截至 8 月 8 日,Scale 列出 Opus 5 为 63.17%,同时列出 Opus 4.8 的结果为 57.26%。Coral 的结果仍然是架构改进的证据,但它不再是被比较条目中得分最高的。

Live messages helped most when the plan was wrong

最大的收益出现在架构和系统设计问题上,这类问题的证据往往跨组件边界。对 Opus 4.6 进行天真的四代理划分会将该类别中解决的任务从 15 件降到 13 件。谈判把数量提高到 24 件,而被动通信则把它提升到 30 件。将一个紧密相连的系统拆分为孤立的任务最初会损害性能;迫使代理协调这些任务则扭转了损失。

Coral 的 MinIO 案例研究展示了这一机制。一个任务要求每次请求有服务器端证据,但最初没有任何代理的计划提到启用审计日志。在阻塞运行中,两个代理分别遇到了日志问题,却未能将其转化为共享证据。其中一个找到了正确的 MINIO_AUDIT_WEBHOOK_ENABLE 开关,但没有向其他人提出。小组随后批准了一个不完整的结论。

在被动运行中,一个代理启用了审计 webhook 并在其他代理仍在工作时发布了生成的记录。一条可用给整个组的检测信息成为了证据,答案从通过 16 项评分标准中的 11 项跃升为通过全部 16 项。

一个 Grafana 任务揭示了 AgentRadio 的边界。四项评分标准要求代理们确定某些行为没有发生。即便在运行了相关测试之后,两种配置都未形成正确的否定性结论。两者都通过了 9 项中的 5 项。消息层可以分发某个代理发现的见解,但它不能分发一个无人最终得出的见解。

Coral is turning research into an orchestration product

AgentRadio 符合 Forder 和 Carroll 在 CoralOS 上的更广泛押注,Coral 将其描述为企业代理系统的编排与治理层。CoralOS 的构建围绕连接来自不同框架的代理、监控它们的行为以及允许现有 API 或 MCP 服务器参与代理工作流展开。Coral 的团队页面表示,该研究还通过一款名为 Coral Code 的编码产品实现了商业化。

这一策略将 Coral 放在模型提供商之下、各个代理挂钩之上。企业可以在基准排名变化时更换模型,同时保留协调、监控和审批逻辑,这些逻辑决定了代理如何协同工作。AgentRadio 的设计强化了这一立场,因为其消息服务器在 Claude Code 之外运行,并通过 shell 命令进行通信,而不是修改 Anthropic 的挂钩。

该基准结果为 Coral 提供了一个在技术上可信的论证示例。它也界定了编排厂商面临的负担:他们必须证明,在考虑到 token 花费、重复工作、错误传播以及更强基础模型的出现之后,通信确实能提升完成工作的质量。

AgentRadio 在一个故意设置得很难的代码理解测试中通过了这一门槛。它相对于单个 Opus 4.6 代理的 29.8 个百分点增益,远大于以类似预算进行多次独立运行所获得的 5.6 个百分点增益。一个更新的单一模型已经追上了头条分数。Coral 的持久性结果是其背后的受控发现:当代理来自相同模型并且能在执行结束前互相修订彼此的调查时,表现明显更好。

Reader comments

Conversation for this story loads after sign-in.