Wiz 表示 Project Atlas 使用代理系统击败了前沿网络模型
据报道,90.9% 的 CyberGym 得分表明系统设计优于模型选择,尽管 Wiz 尚未公布 Atlas 的方法论或访问细节。
By Ryan Merket · Published
Primary source: Forbes
Why it matters
Project Atlas supports a broader shift in AI security: orchestration, validation and proprietary context are becoming the durable assets, while the underlying models remain replaceable inputs.

在7月27日, Assaf Rappaport 的 Wiz 推出 Project Atlas,这是一个漏洞研究系统,将安全调查的不同部分分配给专门的 AI 代理和模型,据 Forbes 报道。Wiz 告诉 Forbes,Atlas 在 CyberGym 上得分为 90.9%,领先于 Anthropic、OpenAI 和 Microsoft 已公布的结果。
这一宣布是对 Rappaport 及其共同创始人 Ami Luttwak、Roy Reznik 和 Yinon Costica 在 Google 支持下能够构建的东西的早期一瞥。这四位创始人此前创建了云安全提供商 Adallom,于 2015 年将其出售给 Microsoft,并在 Microsoft 内部负责云安全职能,随后于 2020 年创立了 Wiz。Google 在 3 月 11 日 完成了以 320 亿美元现金收购 Wiz 的交易,将 Wiz 纳入 Google Cloud 的同时仍保留其品牌和多云产品战略。
Project Atlas 也延续了创始人在两家公司中一直追求的一个论点:当安全产品围绕风险汇集上下文而不是仅产生孤立警报时,它们会变得更有用。Wiz 在代码、云基础设施和运行时活动上均采用了这种方法。Atlas 在漏洞研究过程中应用了这一方法,将工作划分给可以检视代码、质疑发现并为每项任务选择合适模型的代理。
系统就是产品
Nir Ohfeld,负责 Wiz 的漏洞研究,在接受 Forbes 采访时给出了对架构最清晰的描述:“Atlas 不是一个模型。它是一个使用多个模型的系统。”
这种区分很重要,因为模型排名可能会随着每次发布而改变。以可互换模型为核心构建的系统可以将难题推给前沿模型,使用更便宜的模型处理高体量的审查,并将候选漏洞送入单独的验证阶段。周边的软件、提示、工具、重试逻辑和证据生成在新的底层模型到来时仍然可以发挥作用。
Wiz 通过自身评估已得出类似结论。今年二月,Wiz 发布了一个包含 257 个安全挑战的 AI Cyber Model Arena。Wiz 发现结果取决于模型与代理脚手架的组合,没有任何配对在所有类别上均领先。Project Atlas 将这一研究观察转化为一个可运行的漏洞流水线。
据 Wiz 向 Forbes 提供的信息,Atlas 已在开源项目中发现了 200 多个此前未知的漏洞。Wiz 还表示,早期版本发现了一个 GitHub.com 的漏洞,获得了 100,000 美元的赏金。Wiz 尚未公开足够细节以供独立评估这些声明,包括受影响的 GitHub 系统、披露记录、Atlas 的模型配置或误报率。
目前 Atlas 的可用性也未确定。在 Forbes 报道同时,Wiz 和 Google 并未为 Atlas 发布产品页面、技术论文、公共排行榜条目或访问计划。这就留下了 Atlas 是否会成为 Wiz 的产品、Google Cloud 的服务、内部研究系统,或是面向特定软件维护者的有限工具的悬而未决的问题。
基准测试证明了什么
报道中提到的 90.9% 结果将使 Atlas 超过若干已公开的 CyberGym 分数。OpenAI 在六月扩展 Daybreak 时为 GPT-5.5-Cyber 报告了 85.6% 的结果。Anthropic 的 Mythos Preview research 描述了一个能够在主要操作系统和浏览器中发现并利用漏洞的模型。Microsoft 在五月为其多模型代理式扫描系统 MDASH 报告了 88.45% 的 CyberGym 分数。
OpenAI 的数字也显示了为何比较需要精确来源:Forbes 列出 GPT-5.5-Cyber 为 85%,而 OpenAI 自身在 6 月 22 日的公告中报告为 85.6%。
CyberGym 规模可观,涵盖了 188 个软件项目的 1,507 个漏洞。其主要任务是向代理提供一个漏洞描述和相关代码库,然后要求其生成能够再现该缺陷的概念验证。高分表明在该设置下具备代码导航、推理和漏洞复现能力。但这本身并不能证明 Atlas 在对陌生的生产系统进行盲审时能发现未知漏洞。
Microsoft 的结果提供了一个重要的对比,因为 MDASH 同样使用了多模型组合而非依赖单一模型。Microsoft 表示 MDASH 协调了 100 多个专门代理,并发现了 16 个包括在其五月安全更新中的漏洞。Wiz 与 Microsoft 的并行开发表明,这种架构正成为 AI 安全研究的一个共同方向,而非 Wiz 的独家发现。
Google 为 Wiz 提供了更大的模型阵容
Forbes 报道称,Wiz 在 2025 年 12 月的 ZeroDay.cloud 比赛后开始开发 Atlas。该活动为研究人员提供了云和开源目标,Wiz 表示参与者在发现关键漏洞后获得了 320,000 美元的奖金。ZeroDay.cloud 的经历为 Ohfeld 的研究团队提供了证据,表明 AI 辅助的漏洞工作正从演示转向可重复的工作流。
Google 的收购改变了该项工作可用的资源。Forbes 报道称,Wiz 在开发 Atlas 时与 Google 内的多个团队合作,包括 DeepMind。接触到多种模型族、更多安全研究人员和 Google 的计算基础设施,使 Wiz 能够将系统作为一个编排者进行测试,而不是将其绑定到一个旗舰模型上。
这就是 Atlas 对 Rappaport 团队的战略价值所在。Wiz 进入 Google 时带着一个将开发与生产风险连接起来的安全图谱。Project Atlas 为 Wiz 提供了一种在这些弱点成为客户暴露之前上游生成新漏洞情报的途径。如果 Wiz 能将已验证的发现与其已销售的代码、云和运行时上下文相连接,Atlas 就可能为更广泛的 Wiz 平台提供数据,而不仅仅停留在独立的研究项目中。
剩下的工作发生在发现之后。只有在研究人员验证漏洞、协调披露并提交经过测试的补丁后,漏洞才会降低风险。OpenAI 明确将 Daybreak 组织在该修复循环周围,而 Microsoft 将 MDASH 设计为在结果到达工程师前进行争辩、去重和证明。Wiz 已为 Atlas 提供了强有力的发现数据。Rappaport 和 Ohfeld 面临的考验是,该系统能否持续地将这些发现转化为修复,而不会为维护者制造另一个需要他们分拣的待办队列。