情報処理推進機構(IPA)に置かれたAIセーフティ・インスティテュートは10月2日、生成AIがソフトウェアの脆弱性をどこまで実際に悪用できるかを測った「AI検証ノート」を2本公表した。重み(パラメータ)が公開されていて誰でもダウンロードして動かせる「オープンウェイトモデル」のGLM-5.2と、米アンソロピック社のClaude Opus 4.7・4.8を比べたもので、同機関は高度なサイバー能力のオープンウェイトモデルへの拡がりは「現時点では限定的」と結論づけた。

「どこまで悪用できたか」を5段階で測る

評価に使ったのは、カーネギーメロン大学が開発・公開したベンチマーク「ExploitBench」。Google Chromeなどで使われるJavaScriptエンジンV8の既知の脆弱性を対象に、AIエージェントが脆弱性の特定から攻撃コードの生成・発展までどの段階に到達できるかを測る。

評価対象のモデルには、その脆弱性を含むV8のソースコード、ビルド環境、デバッガといった道具をそろえた実行環境が渡される。モデルはそれらを自分で呼び出しながら、脆弱な処理を見つけ、バグを再現させ、攻撃コードを書いて直していく。

到達段階は、深刻度が最も低いT5(脆弱な処理の特定)から、最も高いT1(システム外部での任意操作)までの5段階。各段階に割り当てられた計16の能力項目のうちいくつ獲得したかで0〜16点のスコアが付く。V8の既知脆弱性41件をそれぞれ1回ずつ(最大300ターン、最大5時間)走らせた。

平均2.80対5.22、最高到達はT3段階止まり

41件すべてを通した平均スコアは、Opus 4.8が5.22で最も高く、Opus 4.7が3.63、GLM-5.2が2.80だった。

最高・最低スコアを見ると、Opus 4.8は最高10・最低2。Opus 4.7とGLM-5.2はどちらも最高8・最低0で並ぶが、そのスコアを取ったタスク数が違う。最高の8に届いたのはOpus 4.7が5タスクに対しGLM-5.2は2タスク、最低の0だったのはOpus 4.7が1タスクに対しGLM-5.2は4タスクだった。

到達段階で分けると、GLM-5.2はT5に届かなかったものとT5止まりのものが最も多く、最高でもT3(V8のサンドボックス内のデータの読み書きに相当)にとどまった。これに対しOpus 4.8は、より深刻度の高いT2やT1まで届いたタスクがあった。

費用の面は逆だった。3モデルすべてがT5に到達した36タスクで、初めてT5に届いた時点までのトークン費用を比べると、Opus 4.8が7.34米ドル、Opus 4.7が4.60米ドル、GLM-5.2が3.71米ドルで、GLM-5.2がやや安かった。

同機関は、GLM-5.2には脆弱性を理解して仮説を立てる能力がある一方、失敗した仮説を早く見切って別の方策に切り替える柔軟性がOpus系に比べて足りず、それが到達段階の差につながったとみている。行き詰まりやあきらめを防ぐためにシステム側から助言を送る「ナッジ」の効果も試したが、10タスクの平均スコアは有無にかかわらず3.0で変わらなかった。T5に届いたタスクが5件から6件に増えた一方、境界外書き込みの脆弱性を扱うCVE-2024-4761ではナッジありのスコアが3、なしが5と下がった例もあった。

危険な依頼を断る挙動にも差

安全側の挙動には、はっきりした差が出た。評価環境でGLM-5.2には安全上の拒否応答が確認されなかった一方、Opus系モデルでは拒否応答が見られたとして、同機関は標準設定でのセーフガードの強さに差がある可能性を指摘している。道具の利用と組み合わさることで想定外の挙動が現れる余地もあるとして、注意深い監視が必要だとした。

この「オープンウェイトかどうか」が評価の出発点にある。重みが公開されたモデルは、公開後に提供者が利用のしかたを制限することが難しい。だからこそ能力水準を外から継続して測る必要がある、というのが同機関の立場だ。IPAは9月にも、AIエージェントが開発元の能力評価の最中に実在企業へ無許可で侵入した事例を整理している(AIエージェントが実在企業に無許可で侵入 開発元の能力評価中の逸脱が相次ぎ判明 IPAが「新たな脅威アクター類型」に位置づけ)。

最高段階に一度だけ届き、追試では再現せず

もう1本のノートは、Opus 4.8だけを取り出して調べたものだ。Opus 4.7と直接比べられた40タスクのうち、Opus 4.8は15件で上の段階に、23件で同じ段階に到達し、下がったのは2件だけだった。

41件のうち1件(crbug-1509576)では、最も深刻度の高いT1に必要な2つの能力項目の一方である「pc_control」(プログラムの実行位置の制御)の獲得が確認された。ただしもう一方の「ace」(システム外部での任意操作)は取れておらず、T1には届いていない。実行ログを見ると、モデルは一段低いT2に相当する能力を経ないままpc_controlを獲得しており、ベンチマークが想定する順序とは違う進み方をしていた。モデル自身は「サンドボックスの外に出られない」と判断して試行を終えていた。

同じタスクで追試をしたところ、pc_controlの獲得は再現しなかった。同機関は、AIモデルの評価ではこうした偶発的な到達が起こり得るため、スコアや到達段階だけで優劣を判断せず、実行ログを精査して能力獲得の経緯と再現性を確かめることが重要だとしている。

なお2本のノートはいずれも、モデルの潜在的な能力を把握する目的で、実際の提供時に働くリアルタイムのサイバーセーフガードを解除した状態で実施された評価であり、一般の利用環境での挙動を示すものではないと明記している。評価の実施時期はオープンウェイトモデルの比較が2026年7月、Opus 4.8の評価が同年6月だ。AIモデルの危険度を外から比較できるようにする指標づくりは、開発側からも提案が出ている(Anthropic、最新AI「Fable 5」を世界で再展開 米の輸出規制が解除 「脱獄」対策を強化し危険度の共通指標を提案)。