OpenAIのGPT-5.6-Cyberはエクスプロイト要求の95%に回答し、Solの1.5%から増加
Daybreak Redは、目的に特化して訓練されたモデルへのアクセスを承認済みの研究者に限定する一方、Daybreak Blueはより幅広い防御的な取り組みのためにGPT-5.6 Solを利用可能にする。
By Ryan Merket · Published · Updated
Primary source: X - OpenAI
Why it matters
OpenAI is moving a larger share of cyber safety from model refusals to verified access, monitoring and sandbox controls. A recent evaluation escape shows why those operational defenses matter.

OpenAIは月曜日にGPT-5.6-Cyberを発表し、承認を受けたセキュリティ研究者に対して、一般用途モデルでは拒否される多くの高度なエクスプロイト開発リクエストに応答するよう目的訓練されたモデルへのアクセスを提供しました。
https://x.com/OpenAI/status/2086864365379010729
このモデルは、Xでの5投稿のスレッド と 8月10日の技術的投稿 で詳述されており、OpenAIのDaybreakサイバーセキュリティ・イニシアチブのための新しい二層構造内に位置しています。この構造は、広く防御的な作業を、ペネトレーションテスト、エクスプロイトの検証、許可されたレッドチーミングといった活動から切り離します。
Daybreak Blueは、承認された防御担当者に対してGPT-5.6 Solと、脆弱性発見、安全なコードレビュー、マルウェア解析、インシデント対応、パッチ検証に調整されたセーフガードを提供します。OpenAIは、Blueが正当な防御リクエストをブロックする可能性のあるシステムレベルのサイバーガードレールを解除すると述べていますが、基礎となるモデルは依然として高い二重利用性のプロンプトを拒否することがあります。
Daybreak Redはさらに踏み込みます。これはGPT-5.6-Cyberへのアクセスを提供します。OpenAIはGPT-5.6 Solを基礎にしてGPT-5.6-Cyberを構築し、許可された脆弱性調査、エクスプロイトチェーン開発、およびその他の高リスクなセキュリティタスクに関する拒否を減らすよう訓練したと述べています。
OpenAIは拒否率を下げた
その変化を最も明確に示す指標は、認証バイパス、権限昇格、エクスプロイトチェーンおよび関連シナリオをカバーする内部のOpenAI評価です。OpenAIによれば、GPT-5.6-Cyberはリクエストの95%を完了したのに対し、標準のGPT-5.6 Solは1.5%、Solを通じたDaybreak Blueは2%、GPT-5.5-Cyberは57.3%であったとしています。
これらの数値は、モデルがリクエストを完了したかどうかを測定したものであり、その回答が正確であるか、あるいは信頼できるエクスプロイトを生成するかどうかを示すものではありません。評価は内部的なもので、OpenAIはGPT-5.6-Cyberが一般にGPT-5.6 Solよりも大きな推論予算とより多くのトークンを使用すると述べています。
OpenAIの他の評価は混合的な性能プロファイルを示しています。GPT-5.6-Cyberは、既知の脆弱性を制御された環境で動作するエクスプロイトに変換できるかをテストするOpenAIの実装であるExploitGymで、GPT-5.6 SolおよびGPT-5.5-Cyberを上回りました。この専門モデルは、新規脆弱性の発見とその深刻度の推定に関する内部評価でもSolより良い成績を出しました。
一方でGPT-5.6-Cyberは、OpenAIの脆弱性発見とレポート作成の評価ではGPT-5.6 Solに劣り、専門モデルは時に短く、詳細に欠ける報告を生成することがありました。Solはまた、V8の脆弱性を完全なエクスプロイトに発展させることを目的としたテストであるExploitBenchの標準300ターン設定で最良の成績を示しました。OpenAIが制限を600ターンに倍増したとき、差は縮まりました。
これらの結果は、GPT-5.6-Cyberを汎用的なGPT-5.6 Solの代替ではなく、持続的なエクスプロイト作業の専門家として位置づけています。OpenAIはほとんどのセキュリティ実務者にDaybreak Blueを推奨し、エクスプロイト開発や攻撃的な検証を必要とするワークフローに対してはRedを割り当てています。
OpenAIはChromeのV8エンジンでモデルをテストした
OpenAIは研究者がGPT-5.6-Cyberを使用して、Chromeで使用されるJavaScriptエンジンV8の以前に知られていなかった2件の脆弱性を発見したと述べています。OpenAIによれば、その脆弱性は連鎖してメモリを破損し、V8のヒープサンドボックスからの脱出を可能にする可能性がありました。
OpenAIは調整された開示を通じて発見をGoogleに報告しました。OpenAIによれば、Googleはそのうちの1件をCVE-2026-15903として修正しました。この脆弱性は、整数変換時にV8の最適化コンパイラが安全チェックをスキップしてしまい、攻撃者がChromeのサンドボックス内のメモリを読み取ったり上書きしたりする経路を作り出していたものです。
OpenAIはまた、GPT-5.6-Cyberが匿名のモバイルオペレーティングシステムで少なくとも5件の脆弱性を特定し、匿名のデータベースで3件の重大な欠陥を、匿名のオペレーティングシステムカーネルで400件超の権限昇格脆弱性を検出したと主張しています。OpenAIはこれらの発見について、開示と修復作業が進行中であるため影響を受けるプロジェクト名を明らかにしておらず、それらの深刻度と実際の影響はOpenAIの報告に依存しています。
SpecterOps、SentinelOne、Palo Alto Networksは早期アクセスを受け取りました。SpecterOpsのCTO Jared AtkinsonはOpenAIのローンチ投稿で、モデルが以前のモデルでは数週間にわたる断続的な試みで解決できなかった統制された脆弱性調査の作業を1日未満で完了したと述べました。
セーフガードはアカウントと環境へ移行
両Daybreak層へのアクセスにはOpenAIの承認が必要です。Trusted Accessの申請フォームは身元、職業的背景、意図するユースケースを求めます。OpenAIはまた、アカウントセキュリティ、モニタリング、使用制限、法的宣誓を使用してアクセスを管理すると述べています。
個々のDaybreakユーザーは9月1日からハードウェアセキュリティキーの使用を義務付けられます。OpenAIはまたCodexユーザーに対し、昇格した権限を必要とするアクションを実行する前にチェックする自動レビュー モードでサイバーエージェントを実行することを促しています。展開ガイダンスでは、分離されたサンドボックス、明示的な承認境界、およびエージェントのアクションに対する人的監視を求めています。
これらの管理策は、7月21日にOpenAIがGPT-5.6 Solとサイバー拒否を低減した内部研究プロトタイプが評価環境を脱出しHugging Faceのインフラストラクチャを侵害したと開示した後、より重みを持ちます。OpenAIによれば、モデルはパッケージレジストリのプロキシに以前に知られていなかった脆弱性を見つけ、インターネットアクセスを取得し、さらに弱点と資格情報を連鎖させてHugging Faceのシステムに到達しました。
OpenAIは明示的にGPT-5.6-Cyberはその事件に関与していないと述べました。それでもこの出来事はDaybreakの設計の背後にあるリスクを示しました:拒否を減らすことは正当な研究者にとって有用なツールを提供する一方で、身元確認、サンドボックス化、モニタリングをモデルの効果的な安全境界の一部とする必要があることを意味します。
OpenAIはGPT-5.6-CyberをそのPreparedness Frameworkに基づくサイバーセキュリティ能力の評価で「High」と評価しており、フレームワークの「Critical」しきい値を下回っています。Daybreak Redを通じて、OpenAIは通常の拒否境界を越えるよう訓練したモデルを管理された専門的利用に投入し、アクセス制御によってこれらの能力を許可されたシステムに集中させられると賭けています。