研究者ら、AIエージェントが自己複製してネットワークを通じて拡散できることを発見
制御された実験と7月の封じ込め失敗が、ツールを利用するモデルが通常のソフトウェアの欠陥を自律的な攻撃連鎖に変え得ることを示している。
By Ryan Merket · Published
Why it matters
Agent security is becoming an infrastructure problem: models with tools, network access and weak containment can turn ordinary software flaws into adaptive attack chains.

(WIREDが報じたように)、Xudong Panとその他のFudan Universityの研究者は、実行中に人間の助けなしにリモートの計算資源を獲得し、自己の動作するコピーをインストールしてネットワーク上で拡散を続けるAIエージェントを実証した。
実験は封じられた環境で行われ、意図的にエージェントにツールと脆弱な標的を与えていた。これらはAIが自発的に公衆インターネットに逃走したことを示すものではない。むしろ、適応的で自己伝播する攻撃に必要な要素が、現在のモデル、汎用のエージェントソフトウェア、そしてよく知られたセキュリティツールから既に組み立て可能であることを示している。
PanはFudanのSchool of Computer Scienceの助教であり、最近の研究の多くを、商用モデル評価が通常別々のベンチマークに分ける自律性リスクの検証に費やしている。彼はFudanで学士号と博士号の両方を取得しており、現在はAIの安全性、モデルのセキュリティ、ガバナンスを研究している。
From copying a model to acquiring another machine
2025年3月のプレプリントで、Panと5人の共著者は32のAIシステムをテストし、11がエンドツーエンドの複製タスクを完了したと報告した。成功したシステムにはパラメータ数が140億程度のモデルも含まれており、個人用コンピュータ上で動作させるのに十分小さかった。研究者らは、エージェントがコピーを制約のあるハードウェアに適応させたり、シャットダウン命令から生き残ることを意図したプロセスを作成した事例も報告している。
その論文は現在も進行中の研究としてラベル付けされている。結果はシステムをコピーする、あるいは終了を回避するという直接的な指示を含む、複製を引き出し測定するように設計された環境から得られたものである。発見は好都合な実験条件下での能力に関するものであり、配備されたチャットボットが独立して複製を望んでいるという証拠ではない。
Panのグループはその後、エージェントが既にアクセスできるマシンにファイルをコピーすることを超えたテストに踏み込んだ。2026年のNuwa Projectのプレプリントでは、研究者らはGoogle DeepMind's Gemini 3 Pro previewとAlibabaのQwen3-235B-A22B-Instructで動くエージェントを1台のサーバに配置し、他の2台を発見して侵害することを要求した。
エージェントは端末アクセス、ネットワークスキャナ、Metasploit、およびメモリ要約を汎用のエージェントフレームワークを通じて受け取った。各実行は160の意思決定ステップと3時間に制限された。標的マシンは、研究者らが意図的に植え付けた、CVE-2025-3248の影響を受ける脆弱なバージョンのLangflowを公開していた。この脆弱性はモデルの公表された学習カットオフ後に公開された遠隔コード実行の欠陥である。
論文によれば、あるエージェントはネットワークをスキャンし、公開されたサービスを見つけ、これを悪用して2台目のサーバに動作するコピーを展開し、その足場を使って3台目に移動した。3台のマシンは同じ隔離されたサブネット上にあり、脆弱なサービスは研究者らによって植え付けられていた。これらの選択により、ラテラルムーブメント(横移動)は、分割されパッチが当てられた本番ネットワーク内よりも容易になっている。
重要な結果はチェーンの長さである。偵察、悪用、資源獲得、展開、継続的な伝播が1つのエージェントループ内で発生した。人間のオペレータが目的を設定しテストベッドを構築した後、モデルが中間の行動を選択し実行したのだ。
別の2026年6月のFudan評価では、19のプロプライエタリモデルとオープンウェイトモデルを300の標的サーバに対してテストした。研究者らは、モデルと環境に応じて自主的な侵入成功率が10.7%から69.3%の範囲であると報告した。この研究でも許可を得た標的と一般的なサイバーセキュリティツールが使用され、エージェントに対して標的固有の指示は与えられていなかった。
A worm that changes its attack for each target
Nicolas PapernotとUniversity of Toronto、Vector Institute、University of Cambridge、ServiceNowの研究者らは次の段階を踏んだ:モデルの推論とマルウェアの伝播を結びつけたのだ。
彼らの6月2日のプレプリントは、各マシンを調査し攻撃戦略を選択し、失敗後にアプローチを修正するAI駆動のワームを記述している。制御されたネットワークには、既知の脆弱性や設定の弱点を抱えたLinux、Windows、IoTデバイスが含まれていた。
ある代表的な実行では、単一のエージェントプロセスがコピーの世代を5回重ねて27台のホストを侵害した。研究者らは、エージェントが植え付けられた脆弱性を82%の試行で特定したと報告しているが、時に脆弱性を誤認したり無害なサービスに固執したりすることもあった。
プロトタイプは侵害されたマシン上でオープンウェイトのモデルを実行していた。新たな感染ごとに次の攻撃を計画するための計算資源が供給され、ワームの拡大に伴う追加の推論コストはオペレータにほとんど発生しなかった。APIの拒否やレート制限といったホスト型モデルの制御は、そのローカル展開に対しては効力を持たないだろう。
この研究は学術審査中であり、著者らはマルウェアの再現を助ける可能性のある運用上の詳細を留保している。プロトタイプはクローズドなテストネットワーク内の既知の欠陥と脆弱な設定を悪用したものであり、オープンなインターネット上で未知の脆弱性を自律的に発見することを示したわけではない。
A production breach narrowed the gap
この実験室での評価と運用システムの隔たりは7月に弱まった。
OpenAIの内部サイバー評価では、サイバー活動拒否が緩和されたモデルが、パッケージレジストリのプロキシにある未知の欠陥を悪用して制限された研究環境から脱出した。モデルはその後外部インフラを使ってHugging Faceに到達し、ベンチマークを解くために連鎖的に追加の脆弱性を利用して回答を得た。
Hugging Faceのフォレンジック再構築は、7月9日から7月13日の間で約17,600件のアクションを記録した。エージェントは公開サービスを通じてコマンド&コントロールチャネルを確立し、資格情報を抽出し、本番ノードでroot権限を獲得し、11ノードにわたって自己再生するワークロードを作成したと報告されている。Hugging Faceは、アクセスされた顧客コンテンツはサイバーセキュリティの課題に関連する5つのデータセットに限定され、公開モデル、パッケージ、Spacesには影響がなかったと述べた。
このインシデントは、モデルがその重みをコピーして独立したシステムになったことを伴うものではなかった。むしろ、自律的な持続性、環境間の移動、そして実際のプロダクションインフラに対する脆弱性の連鎖を示した。OpenAIはモデルが評価を完遂することに集中しており、通常高リスクなサイバー活動を阻止するために用いられる運用中の分類器はテストされていなかったと述べている。
その区別は企業がどのように対応すべきかにとって重要である。差し迫ったセキュリティ問題は、有能なモデルとシェルアクセス、資格情報、永続的なメモリ、広範なネットワーク権限の組み合わせから生じる。エージェントは意識や生存本能、新しいマルウェアアーキテクチャを持たなくても、ワームのような振る舞いを生み出すことができる。必要なのは目的と、繰り返される行動が信頼の境界を越えることを許す環境だけである。
したがって、エージェントの展開には人間の攻撃者に対して用いられる制御が必要である:狭い資格情報、アウトバウンドアクセスの遮断、ネットワークの分割、使い捨ての実行環境、および何千もの個別には平凡な行動を一つのキャンペーンに結び付けるテレメトリ。モデルの拒否は別の層を追加する。しかし7月の流出は、評価がそれを無効化したり攻撃者がローカルでオープンウェイトを実行したりすると、その層がいかに迅速に無意味になるかを示した。