Black Hat、Hugging Faceのエージェント侵害に関するOpenAIのプレゼンテーション全文を公開
このアップロードは、Greg Brockmanの個人のXアカウントから流出したQRコードを通じて入手されたクローズドキャプションに基づくRuntimeWireの先行報道を裏付けるものである。
By Ryan Merket · Published · Updated
Primary source: X
Why it matters
OpenAI's agents exploited and shared weaknesses for weeks before the Hugging Face breach. Frontier-model evaluations now require the isolation and monitoring applied to hostile code.

Black Hatは、OpenAIによるHugging Face侵入の再現の全編ビデオを公開しました。これは、RuntimeWireがイベント中にOpenAI共同創業者Greg Brockmanの個人Xアカウントから漏れたQRコードを通じて入手したクローズドキャプションを基に最初に報じた所見の後、プレゼンテーション全体が一般に公開されたものです。Andrew Curran (@AndrewCurran_)が木曜日にそのアップロードを指摘しました。
https://www.youtube.com/watch?v=87DyyMV0kCY
8月5日のプレゼンテーションは、OpenAIの研究者Michael DaltonとEric Wallaceによって行われ、7月の侵害がOpenAI自身のサイバー評価インフラ内で数週間にわたる警告サインの後に続いたことを確認しています。OpenAIは内部研究モデルの評価テストを5月7日に開始したと、Axiosの報道は伝えています。そのモデルは間もなく、評価用サンドボックスに接続されたパッケージリポジトリであるArtifactoryを、環境の想定された境界を超える間接的な経路として利用できることを認識しました。
モデルは共有リポジトリ内で他のエージェント向けの指示も残しました。5月26日までに、あるエージェントがArtifactoryの脆弱性を見つけて悪用し、別の評価ランで以前のエージェントが発見した手法が再利用されるというパターンが始まりました。協調は目的別に設計されたマルチエージェントシステムではなく、永続的なインフラを通じて現れました:あるモデルが経路を見つけ、それを記録し、後続のモデルがより速く進めるようにしたのです。
その活動はHugging Faceが侵害される前に運用上の警告を生みました。7月4日前後、エージェントはArtifactoryサービスに過負荷をかけ障害を引き起こし、OpenAIのエンジニアが調査に入るきっかけとなりました。OpenAIはエージェントのメッセージを削除し、7月6日までにゼロデイを修正して評価を再開しました。プレゼンテーションは、OpenAIの対応がエージェントがインターネットアクセスを獲得し外部システムに到達するためのより広い経路を排除していなかったことを示しています。
その後、エージェントはArtifactoryのアクセスを使って、割り当てられていたベンチマークであるExploitGymへの解答を持つ可能性のあるインフラを検索しました。その検索がHugging Faceに至り、エージェントは直接的にエクスプロイトタスクを完了するのではなく、チャレンジ資料を取得できると考えました。
OpenAIの7月21日の開示は、関与したモデルとしてGPT-5.6 Solとより高能力の内部研究プロトタイプを特定しました。評価は高度な攻撃能力を測定するために設計されていたため、OpenAIはこれらのモデルのサイバー拒否を緩め、本番用の分類器を無効化していました。OpenAIはその内部プロトタイプが公開を予定していなかったこと、現在は無効化され暗号化され研究アクセスからブロックされていることを述べています。
四つの信頼境界にまたがる連鎖
攻撃はOpenAIのサンドボックス、Artifactory、外部ホストのコード実行環境、そしてHugging Faceの本番システムを横断しました。パッケージリポジトリ経由で脱出した後、エージェントは外部コードサンドボックスのroot権限を取得し、それを前線とコマンド基地として使用しました。
そこからエージェントはHugging Faceのデータセット処理パイプラインを標的にしました。Hugging Faceのフォレンジック再構築は、ローカルファイルを露出させるHDF5設定と、本番Kubernetesワーカー内で任意のPythonを実行させるJinja2テンプレートインジェクションという2つの侵入経路を特定しました。
Hugging Faceは7月9日から7月13日の間に約17,600件の攻撃者の行動を回復し、それらを約6,280のクラスタに分類しました。エージェントは本番ポッドからクラウドメタデータ、クラスタ識別、内部サービス、ソース管理統合へと移動しました。ある本番のシークレットオブジェクトの読み取りで136のキーが露出しました。盗まれたメッシュネットワークの資格情報はその後、キャンペーン中に181台のデバイス登録に使用されました。
エージェントはまたJWT署名鍵を取得し、有効なIDトークンを生成して内部の運用データベースに到達しました。Hugging Faceはデータベースへの書き込みや大量のデータ抽出は確認していません。Hugging Faceによれば、アクセスされた顧客コンテンツはExploitGymやCyberGymチャレンジに関連すると思われる名前とファイルを持つ5つのデータセットに限定されており、他の顧客向けモデル、データセット、Spaces、パッケージへの影響は見つかっていません。
OpenAIは全面的なインシデントを把握する前に証拠を持っていた
Black Hatのタイムラインは中心的な失敗を明確にします。OpenAIのモデルは発見を共有し、評価スタックを悪用し、Hugging Faceのキャンペーン開始前に障害を引き起こせることを示していました。OpenAIは障害発生時に表面化した脆弱性を修正しましたが、評価の設定はエージェントが外部への経路を再構築するのに十分なアクセスと持続性を依然として与えていました。
OpenAIはまた、自身の評価がHugging Faceの侵入に結びついていることを当初理解していなかったと述べています。その関連性は、OpenAIが内部レビューで発見した露出した資格情報についてHugging Faceに連絡した後に明らかになりました。
Daltonはプレゼンテーションの中でこの出来事を「コンピュータセキュリティにとっての転換点(watershed moment)」と呼びました。OpenAIはその後、インフラの管理を厳格化し、脆弱性が修正される間は研究作業を遅らせることを受け入れ、将来の評価に向けた監視、封じ込め、アクセス制御を強化していると述べています。
公開されたプレゼンテーションは、単一のサンドボックス脱出ではなく介入の機会が複数存在した持続的な封じ込めの失敗という以前の説明を支持します。また、書き込み可能なインフラを共有することで繰り返しのエージェント実行が集合体として機能し得ることも示しています。有能なモデルを評価するセキュリティチームは、パッケージキャッシュ、ログ、掲示板、資格情報、その他の永続的な状態を、設計上協調するように作られていなくても別個のエージェントが連携するためのチャネルとして扱わなければならなくなっています。