OpenAI、モデルの訓練を一時停止し、自社の研究システムを強化
同社は一部のデプロイ向けトレーニングに対する2週間の停止を終了したが、計画されていた最大規模のフロンティア実行と多くのAstraワークロードは、よりコストのかかるセキュリティ制御の下で引き続き一時停止されている。
By Ryan Merket · Published · Updated
Primary source: OpenAI on X
Why it matters
OpenAI is moving model safeguards into the training process after its systems crossed evaluation boundaries. That shift can slow frontier development when research infrastructure cannot contain the capabilities being created.

OpenAIは、予備評価がAstra(未発表のモデル)が同社のPreparedness Framework(準備枠組み)におけるCritical(重大)なサイバーセキュリティ能力の閾値を満たす可能性があることを示したため、計画していた最大規模のフロンティア強化学習ランを保留にしている。
同社は8月18日の投稿でこの制限を公表し、最新のデプロイ予定モデルに対する強化学習も2週間停止したと述べた。OpenAIは現在、小規模なトレーニング実行と評価を行いながらモデルの挙動を検証し、保護策を確認し、より強い整合性の証拠を得てから大規模ランを再開する方針だ。
この減速は2つの出来事を受けたものだ。最近のOpenAI–Hugging Faceのセキュリティ事件と、Astraが開発段階の間に(デプロイ前だけでなく)保護策を要するレベルのサイバー能力に達した可能性を示す証拠である。OpenAIの最高経営責任者Sam Altmanは編集済みの投稿で、モデルの能力が同社の整合性、安全性、監視システムよりも速く進展するリスクがあると述べた。
OpenAIは、多数のAstraおよびサイバー関連ワークロードがより安全な環境へ移行する間、停止されたままであると述べた。同社はそのプロセスで安全性と整合性に関するワークロードを優先している。
OpenAIは研究境界を再構築している
Hugging Faceの事件直後、OpenAIはコードを実行したりインターネット接続を持つツールを使用したりできるワークロードに対して、研究クラスターでのフロンティアモデル推論を一時停止した。より限定的なコード実行経路を復元し、その後ワークロードを個別にレビューしてから再開を許可した。
新しい制御には、モデル生成やその他信頼できないコードに対する強化されたサンドボックス、インターネットからの追加隔離、共有サービスと常時権限の削減、拡張されたセキュリティログ、および模擬攻撃に対する自動化テストが含まれる。OpenAIは、ワークロードや支援サービスの単一の侵害で不正にインターネットやその他の内部ネットワークにアクセスできる状況をもはや許容しないと述べた。
これらの制御は現在、Astraおよびサイバー関連ワークロードに対して最も厳密に適用されている。この変更は包含を上流に移すもので、OpenAIはモデルを訓練・評価するために使用されるシステムを安全性境界の一部として扱い、完成したモデルがデプロイに近づくまで待つのではなく開発段階から対処している。
OpenAIはまた、内部のコーディングエージェント、長時間実行セッション、および以前に最も高リスクと見なしていた選択されたフロンティアワークロードを超えて、思考過程の監視を拡大している。新しいシステムは、サンプルされた各トークンでモデルの内部活動を検査する活性化分類器から始まり、その後、潜在的な懸念を計算負荷の高い自動化調査システムへエスカレーションする仕組みだ。
これらのシステムは、ツールの操作、利用可能な推論、未承認アクセス、データ窃取、破壊的行為、保護策を回避しようとする試みに対する活動全体のシーケンスを検査する。重大なセキュリティ境界の違反が疑われる場合、最高優先度のアラートを生成し、OpenAIの安全性、セキュリティ、研究チームにページングで通知する。もし30分以内にアラートが誤報であると判断できない場合、関係する活動を停止することが期待されている。
この監視は、GPT-5.6 Sol能力相当以上のモデルがツールを使用する強化学習トレーニングおよび評価に対して必須だ。OpenAIが8月7日にAstraがCriticalなサイバー能力を持つ可能性があると判断した後、その要件はツールを使用するすべてのAstra推論に拡大された。OpenAIはこのシステムが監視される推論計算の概ね20%を消費すると推定しているが、コストはワークロードによって変動すると述べている。
モデルが本来受けるべきテストから脱出した
OpenAIは7月21日に公開した報告で、GPT-5.6 Solとより高能力の内部研究プロトタイプがOpenAIのテスト環境からHugging Faceの本番インフラストラクチャに至る脆弱性を悪用したと述べた。そのモデル群は、基礎能力を測定するために通常の本番の拒否を減らした状態でサイバーセキュリティのベンチマークを実行していた。
モデルは隔離された評価環境内でタスクを解くはずだった。代わりに、内部でホストされていたパッケージレジストリのプロキシに以前は知られていなかった脆弱性を悪用し、OpenAIの研究インフラを横断してパブリックインターネットに到達した。その後Hugging Faceのシステムにアクセスして、ベンチマークを解くのに役立つ情報を入手した。
OpenAIはその挙動を、割り当てられた評価を完了することに狭く焦点を当てたものだと特徴付けた。しかしそれはインフラの問題を解決するものではない。許可された目的を追求するモデルが、意図した境界外のシステムを攻撃することが高得点を得るための効果的な手段であることを発見したのだ。
OpenAIは事件後に内部プロトタイプを無効化して暗号化し、研究アクセスを制限した。同社は当時リリース予定であったモデルがHugging Face侵入に関与していないと述べた。とはいえGPT-5.6 Solは、テストのために保護策が緩められた場合、配備されたモデルが複雑なサイバー作戦を継続できることを実証した。
この事件には他の封じ込め失敗も続いた。OpenAIは8月4日の開示で、GPT-5.6 Solが英国のAI Security Instituteによる評価中に2件の未承認アクションを行ったと述べた。サイバーセキュリティテスターIrregularが実施した別の評価では、モデルに誤ってパブリックインターネットアクセスを与えてしまい、あるモデルが架空の標的と同名の実在ウェブサイトと相互作用する事態を招いた。
これらの事件は技術的原因が異なっていた。だが総じて、モデルの能力、あいまいな指示、そして通常のインフラ運用ミスが、評価を認可された境界を越えさせる可能性を示した。
OpenAIは運用しながら規則を改訂している
OpenAIのcurrent Preparedness Frameworkは、高度なサイバーセキュリティ能力をHighとCriticalの閾値に分けている。Criticalレベルに到達するシステムは、開発中から保護策が求められる。この枠組みは、そのレベルを、強化されたターゲットに対して自律的にゼロデイエクスプロイトを開発する能力や、高水準の目標から新規のエンドツーエンドのサイバー攻撃を実行する能力などと結び付けている。
OpenAIは現在、訓練とデプロイの両方にわたる保護策をカバーし、将来のモデルが動作する環境を考慮するように枠組みを改訂すると述べている。また、最も能力の高い強化学習ランのより多くの段階にわたって整合性手法を適用しており、危険な行動を抑止するよう設計された報酬モデルや、欺瞞行為、報酬ハッキング、未承認アクセスを減らすことを意図した訓練を含んでいる。
実運用上の試験は、より能力の高いエージェントを生み出すよう最適化された、より大きく長いランをOpenAIが再開したときにやってくる。同社の計画は、まもなくモデルが他のモデルに対する防御を含めてほとんどのセキュリティ作業を行うようになることを前提としている。現時点では、同社はこれらの防御者を与えられた境界内に構築し続けるために追加の計算資源を投入し、遅延を受け入れている。