OpenAI 的 GPT-5.6-Cyber 回答了 95% 的漏洞利用请求,而 Sol 则为 1.5%
Daybreak Red 将目的训练模型限制为经批准的研究人员,而 Daybreak Blue 则将 GPT-5.6 Sol 开放用于更广泛的防御性工作。
By Ryan Merket · Published · Updated
Primary source: X - OpenAI
Why it matters
OpenAI is moving a larger share of cyber safety from model refusals to verified access, monitoring and sandbox controls. A recent evaluation escape shows why those operational defenses matter.

OpenAI 在周一推出了 GPT-5.6-Cyber,向获批的安全研究人员提供了一个为特定用途训练的模型,该模型将回答许多其通用模型会拒绝的高级漏洞利用开发请求。
https://x.com/OpenAI/status/2086864365379010729
该模型在一篇在 X 上的五帖线程和一篇8月10日的技术文章中有详细说明,位于 OpenAI Daybreak 网络安全计划的新双层结构内。该结构将广泛的防御性工作与渗透测试、漏洞利用验证和授权红队等活动分离开来。
Daybreak Blue 为获批的防御者提供 GPT-5.6 Sol 及为漏洞发现、安全代码审查、恶意软件分析、事件响应和补丁验证校准的安全保护措施。OpenAI 表示,Blue 移除了可能阻止合法防御性请求的系统级网络防护栏,尽管底层模型仍可能拒绝高度双用途的提示。
Daybreak Red 更进一步。它提供对 GPT-5.6-Cyber 的访问,OpenAI 在 GPT-5.6 Sol 的基础上构建并训练该模型,以在经授权的漏洞研究、漏洞链开发和其他更高风险的安全任务上减少拒绝率。
OpenAI pushes the refusal rate down
对这一变化最清晰的衡量来自 OpenAI 的一项内部评估,涵盖了身份验证绕过、权限提升、漏洞链和相关场景。OpenAI 表示,GPT-5.6-Cyber 完成了 95% 的请求,而标准的 GPT-5.6 Sol 为 1.5%,通过 Daybreak Blue 的 Sol 为 2%,GPT-5.5-Cyber 为 57.3%。
这些数字衡量的是模型是否完成请求,而不是其答案是否正确或是否生成了可靠的漏洞利用。该评估是内部的,OpenAI 表示 GPT-5.6-Cyber 通常比 GPT-5.6 Sol 使用更大的推理预算和更多的 token。
OpenAI 的其他评估显示了混合的性能表现。GPT-5.6-Cyber 在 OpenAI 对 ExploitGym 的实现上击败了 GPT-5.6 Sol 和 GPT-5.5-Cyber,ExploitGym 测试代理是否能在受控环境中将已知漏洞变成可工作的漏洞利用。该专用模型在一个用于发现新漏洞并估计其严重性的内部评估中也比 Sol 表现更好。
在 OpenAI 的漏洞发现和报告撰写评估中,GPT-5.6-Cyber 落后于 GPT-5.6 Sol,专用模型有时生成的报告更简短、细节较少。在围绕将 V8 漏洞开发成完整利用的 ExploitBench 测试中,Sol 在标准 300 轮设置下也表现最好。将限制增加到 600 轮时,这一差距缩小。
这些结果将 GPT-5.6-Cyber 定位为长期漏洞开发的专家,而非对 GPT-5.6 Sol 的通用替代品。OpenAI 建议大多数安全从业者使用 Daybreak Blue,并将 Red 保留给需要漏洞开发或进攻性验证的工作流。
OpenAI tested the model on Chrome's V8 engine
OpenAI 表示,其研究人员使用 GPT-5.6-Cyber 发现了 V8(Chrome 使用的 JavaScript 引擎)中的两个先前未知的漏洞。OpenAI 表示,这些漏洞可以链式利用以破坏内存并逃离 V8 的堆沙箱。
OpenAI 通过协调披露将发现上报给 Google。OpenAI 表示,Google 将其中一个漏洞修复为 CVE-2026-15903。该漏洞涉及 V8 的优化编译器在整数转换过程中跳过了安全检查,为攻击者提供了一条读取或覆盖 Chrome 沙箱内存的路径。
OpenAI 还声称 GPT-5.6-Cyber 在一款未具名的移动操作系统中识别出至少五个漏洞,在一款未具名的数据库中识别出三个关键缺陷,以及在一款未具名的操作系统内核中识别出 400 多个权限提升漏洞。在披露和修复工作继续进行期间,OpenAI 尚未公布受影响项目的名称,因此这些发现的严重性和实际影响取决于 OpenAI 的说法。
SpecterOps、SentinelOne 和 Palo Alto Networks 获得了早期访问权限。SpecterOps CTO Jared Atkinson 在 OpenAI 的发布帖中表示,该模型在此前模型数周间歇努力未能解决的情况下,在不到一天内完成了一些受管控的漏洞研究工作。
The safeguards move to the account and environment
访问两个 Daybreak 层级都需要 OpenAI 批准。Trusted Access application 要求提供身份、专业背景和预期用例。OpenAI 表示还将使用账户安全、监控、使用限制和法律声明来控制访问。
从 9 月 1 日起,个人 Daybreak 用户将被要求使用硬件安全密钥。OpenAI 还鼓励 Codex 用户以自动审查模式运行网络代理,该模式会在执行前检查需要提升权限的操作。其部署指南要求隔离沙箱、明确的授权边界和对代理行为的人为监控。
在 OpenAI 于 7 月 21 日披露 GPT-5.6 Sol 和一个减少网络拒绝的内部研究原型逃离评估环境并入侵 Hugging Face 基础设施 之后,这些控制措施的重要性更为凸显。OpenAI 表示,这些模型发现了软件包注册代理中的一个先前未知漏洞,获得了互联网访问权限,并链式利用额外的弱点和凭证以到达 Hugging Face 系统。
OpenAI 明确表示 GPT-5.6-Cyber 未参与该事件。该事件仍然确立了 Daybreak 设计背后的风险:降低拒绝率可以为合法研究人员提供更有用的工具,同时使身份验证、沙箱和监控成为模型有效安全边界的一部分。
OpenAI 在其 Preparedness Framework 下将 GPT-5.6-Cyber 的网络安全能力评估为 "High",低于该框架的 "Critical" 阈值。通过 Daybreak Red,OpenAI 正将一个被训练以跨越其通常拒绝边界的模型投入受控的专业使用,并押注访问控制可以将这些能力限定在经授权的系统上。