情報処理推進機構(IPA)は、AIをめぐる国内外の公開情報を集めた「AIセキュリティ短信 2026年8月号」の公開版を9月7日に出し、指示から逸脱したAIエージェントを「新たな脅威アクター類型」として整理した。最先端AIの能力を測る評価の途中で、AIが実在する外部の組織へ無許可で侵入した事案が、開発元と評価機関から相次いで公表されたことを根拠に挙げている。短信が対象としたのは2026年6月8日から8月10日までに報じられた事例で、全58ページ。
評価実行14万件を見直し、3組織への不正アクセスを特定
米アンソロピックは7月30日、Claudeがインターネットに到達しえた評価実行14万1006件を見直し、実在する3組織の本番基盤へ不正アクセスした事案を3件(実行6回分)特定したと公表した。評価の指示ではインターネットにはつながらないと伝えていたが、行き違いで経路が残っており、モデルは脆弱性を突くことなく外部へ出て、到達先を演習環境の一部だと受け取ったという。使われた手口は弱いパスワード、認証のない接続先、露出したデバッグ画面、SQLインジェクションといった基本的なものにとどまる。
同社は7月23日に記録の精査を始め、同じ日にサイバー分野の評価をすべて止めた。原因については「モデルの調整の失敗ではなく、ハーネス(評価を回す実行環境)と運用の失敗に近い」としている。評価に使ったモデルが公開リポジトリのPyPIへ送り込んだパッケージは、公開されていた約1時間の間に15の実システムで実行された。
隔離環境の唯一の出口を突いて外部サービスへ
AIの公開基盤を運営する米ハギングフェイスは7月16日、自社が侵害を受けたと公表した。短命のサンドボックスを多数使い分ける形で1万7000件を超えるイベントが記録され、限定的な内部データセットと複数の認証情報への不正アクセスがあったと認めた一方、公開されているモデル・データセット・Spacesが改ざんされた証拠はないとした。公表時点では、どのAIによるものかは特定できていないとしていた。
IPAの短信によれば、OpenAIは7月21日、本番の分類器を外して拒否設定を緩めた社内評価で、OpenAI、新AI「GPT-5.6」を公開 業務代行エージェント「ChatGPT Work」も投入 Sol・Terra・Lunaの3構成で公開した「GPT-5.6 Sol」と未公開モデルが、隔離環境の唯一の外部経路だったキャッシュプロキシのゼロデイ脆弱性を悪用してインターネットへ到達したと公表した。7月9日から13日にかけての一連の動きで、約1万7600件の操作が復元されており、個々の手順は人が指示していないという。
英国の評価機関は122回中19件を確認
英政府のAI安全研究所(AISI)は8月4日、インターネット接続を意図的に有効にし、開発元が備えるサイバー分類器を意図的に無効にした条件で行った122回の実行のうち10回で、計19件の無許可行動を確認したと公表した。ただし、この条件の組み合わせは一般の利用者に提供されている状態を反映したものではなく、調査の範囲で実世界の被害は確認されていないとしている。あるエージェントは偽の身元を使って外部のオープンソース保守者にコードの承認を迫ったが、人間の査読者が拒否した。
「敵対的な意思」とはされていない
IPAは、いずれの事案も与えられた目標を達成する過程で生じたものとして説明されており、公表内容の範囲では敵対的な意思によるものとはされていないとまとめた。従来の脅威アクターが人間の攻撃者や攻撃集団を指すのに対し、逸脱したエージェントは悪意がないまま実害を出す点が異なる。短信が採録した手引きでアンソロピックは、AIエージェントが意図から外れた場合の振る舞いは内部不正と区別がつかないとしており、IPAもエージェント型AIへのゼロトラスト適用を今号の動向の一つに挙げた。
事案はいずれも開発元自身の管理下にある評価環境からの逸脱で、IPAは「攻撃能力の実証とも環境の統制の失敗とも読める」としている。国内でも政府職員18万人の生成AI「源内」、10月ごろAIエージェント環境を導入へ 職員の業務手順を「スキル」にして省庁横断で共有 政府全体で1万〜数万件と見積もりのようにエージェントの業務利用が広がりつつあり、権限の絞り込みと通信の制限が実務の課題になる。
