OpenAI、重要なサイバー能力を評価するため、Astraの一部作業を一時停止
OpenAIの未発表モデルはサイバー分野で高い性能を示し、OpenAIが評価を続ける間、隔離テストと全社的な監視を促した。
By Ryan Merket · Published
Primary source: CNBC
Why it matters
Astra tests whether a frontier AI developer can slow work, isolate testing and restrict deployment while a potentially dangerous capability assessment remains unresolved.

OpenAI、共同創設者でCEOのSam Altman (@sama)が率いる同社は、予備評価の結果、同AI開発者が自社の安全フレームワークの下でCriticalというサイバー能力レベルを否定できなくなったため、Astraに関する社内の一部活動を停止した。
OpenAI disclosed the decision on August 7。未発売のモデルであるAstraは予備評価で十分に強い性能を示し、OpenAIはCriticalの閾値を排除できなかった。CNBC reported on August 10は、OpenAIがモデルのテストを継続しつつ一部の社内活動を停止したと報じた。
OpenAIはAstraのテストを隔離された環境に移し、トレーニングや評価を含むモデルのエージェント型アプリケーション全体での危険な行動やミスアライメントを普遍的に監視する体制を実施したと述べた。OpenAIはまた、より高い能力を持つモデルに対する監視および検出機能を追加している。
この開示によりAstraは異例の運用状態に置かれている。開発は遅れ、一部の作業は停止し、OpenAIは評価が未解決の能力レベルに関連する管理措置を適用している。OpenAIはどの社内活動を停止したのか、また制限がどれくらい続くのかを明らかにしていない。
What a Critical assessment would mean
OpenAIのPreparedness Frameworkは、Criticalなサイバー能力を、ユーザーが詳細な指示を与えなくても、高度な防御に対して自律的にサイバー攻撃を行える能力として説明している。
その説明は、OpenAIが評価している閾値を定義するものだ。これはAstraがそれぞれの能力を実証した、あるいは攻撃を実行したという発見を意味するものではない。OpenAIの立場はより限定的で、Astraの予備結果がベンチマークを継続する間はCriticalレベルを排除できないほど強力だった、というものだ。
OpenAIはそのベンチマークが続く間、より厳格なセキュリティ管理を適用していると述べた。同社はAstraが最終的にCriticalの閾値を満たすかどうかは公表していない。
この区別は展開にとって重要だ。脆弱性を発見し長期的な技術作業を実行できるモデルは、セキュリティチームが重大な欠陥を特定して修正するのに役立つ可能性がある。しかし同じ能力への広範なアクセスは、堅牢な標的を攻撃するのに必要な専門知識や監督を減らしてしまう可能性がある。OpenAIはAstraのアーキテクチャ、意図された製品形態、顧客、価格、リリース日、最終的なアクセス方針を明らかにしていない。
Axios reported on August 7は、OpenAIが安全性テストを拡大し、Astraの開発を遅らせ、リリース前に保護策を講じるだろうと伝えた。リリースの時期はすでに不明確であり、Axiosはこれらの制限がリリースを遅らせる可能性があると述べた。
OpenAI's controls leave deployment choices open
隔離されたテスト環境と普遍的な監視は、OpenAIがAstraを観察しつつその行動領域を制限する方法を提供する。公開された説明は、これらの環境の境界、例外を承認できる人物、外部評価者がモデルのサイバー能力を独立してテストするかどうかを説明していない。
OpenAIはまた、Astraが最終的に広く提供されるのか、精査された組織に限定されるのか、内部研究用に保有されるのかについても明言していない。もう一つのフロンティアAI開発者であるAnthropicは、制限付きアクセスのサイバー研究モデルであるClaude Mythos 5を通じて一つの比較例を示している。
AnthropicはProject Glasswing programのパートナーが1万件以上の高重大度またはクリティカルな脆弱性を発見したと述べている。この数値はAnthropic自身の説明だが、同プログラムは開発者が選ばれたセキュリティ組織に高度なサイバー能力へのアクセスを供与しつつ、モデルを広く提供しない方法を示している。OpenAIがAstraに同様の構造を採用するかどうかは示していない。
Astraの評価は、他のモデルやテスト環境に関する第三者評価のインシデントとは別だ。OpenAIはAxiosに対し、Astraは以前のHugging Faceのインシデントには関与していないと述べた。
Altmanはここ10年、能力が増すAIを広く恩恵のために配布できると主張してきており、その立場はOpenAI's founding announcementにも反映されている。Astraはその立場の具体的な試金石を生む:OpenAIが未公開モデルを効果的に管理したまま、その機能と、それを誰が使うべきか(あるいは誰も使うべきでないか)を判断できるかどうかである。