OpenAI 暂停部分 Astra 工作,以评估关键网络能力
OpenAI 未发布的模型展示了强劲的网络表现,促使进行隔离测试和全面监控,同时 OpenAI 继续进行评估。
By Ryan Merket · Published
Primary source: CNBC
Why it matters
Astra tests whether a frontier AI developer can slow work, isolate testing and restrict deployment while a potentially dangerous capability assessment remains unresolved.

OpenAI,由联合创始人兼首席执行官 Sam Altman (@sama) 领导,在初步评估表明该 AI 开发者无法排除其安全框架下 Astra 达到 “Critical” 网络能力级别后,暂停了涉及 Astra 的一些内部活动。
OpenAI 在 8月7日披露了这一决定。Astra 是一个尚未发布的模型,其在初步评估中的表现足够强,使得 OpenAI 无法排除达到 Critical 阈值的可能性。CNBC 在8月10日报道 称,OpenAI 在继续测试该模型的同时暂停了一些内部活动。
OpenAI 表示已将 Astra 的测试转入隔离环境,并在模型的具代理性(agentic)应用中(包括训练和评估)实施了对高风险行为和不一致性的普遍监控。OpenAI 也在为更高能力的模型增加监控和检测能力。
这一披露使 Astra 处于一种不寻常的运作状态:开发放缓、部分工作停止,且 OpenAI 正对一个仍未确定的能力级别应用相应控制。OpenAI 尚未说明其暂停了哪些内部活动,也未说明这些限制将持续多久。
如果被评估为 Critical 将意味着什么
OpenAI 的 Preparedness Framework 将 Critical 网络能力描述为能够在没有用户提供详细指令的情况下,自主对复杂防御发起网络攻击的能力。
该描述界定了 OpenAI 正在评估的阈值。它并不等同于认定 Astra 已经展示了每一项能力或已经实施了攻击。OpenAI 的立场更为狭窄:在基准测试继续进行期间,Astra 的初步结果足够强大,公司无法排除其达到 Critical 级别的可能性。
OpenAI 表示在基准测试继续进行期间正施加更严格的安全控制。公司尚未披露 Astra 最终是否会达到 Critical 阈值。
这一区别对部署具有重要意义。一个能够发现漏洞并执行长期技术任务的模型,可能帮助安全团队识别并修补严重缺陷。但对相同能力的广泛开放可能会降低攻击加固目标所需的专业知识和监督。OpenAI 尚未披露 Astra 的架构、拟推出的产品形式、客户、定价、发布日期或最终的访问政策。
Axios 在8月7日报道 称,OpenAI 将扩大安全测试、放慢 Astra 的开发,并在任何发布前设置保障措施。发布时间本已不明朗,Axios 表示这些限制可能会延迟发布。
OpenAI 的控制措施让部署选项保持开放
隔离测试和普遍监控为 OpenAI 提供了在观察 Astra 的同时限制其作用范围的方法。公开披露并未解释那些环境的边界、谁可以授权例外,或是否会有外部评估者独立测试该模型的网络能力。
OpenAI 也未说明 Astra 是否最终会被广泛提供、仅限于经过审查的组织,或仅保留用于内部研究。另一家前沿 AI 开发者 Anthropic 通过其受限访问的网络研究模型 Claude Mythos 5 提供了一个可供比较的例子。
Anthropic 表示,其 Project Glasswing 计划 的合作伙伴发现了超过 10,000 个高严重性或关键严重性漏洞。该数字为 Anthropic 自行披露,但该计划展示了开发者如何在不广泛提供模型的前提下,向选定的安全组织赋予先进网络能力访问权限。OpenAI 尚未表明 Astra 是否会采用类似的结构。
Astra 的评估与涉及其他模型和测试环境的第三方评估事件是分开的。OpenAI 告诉 Axios,Astra 并未参与早先的 Hugging Face 事件。
Altman 在过去十年间一直主张,日益强大的 AI 可以为广泛利益而分发,这一立场在 OpenAI 的创始公告 中有所体现。Astra 对这一立场提出了一个具体检验:在确定该未发布模型能做什么以及应允许谁(若有人)使用它时,OpenAI 是否能保持有效控制。