AIセーフティ・インスティテュート(AISI)の事業実証ワーキンググループは10月6日、AIの安全性評価をどう整備するかを示す「ビジョンペーパー」の第2.0版を公開した。これまでのヘルスケア、ロボティクスに教育とジオAI(地理空間情報)の2分野を加え、分野横断の2部会と合わせて6つの部会で評価の枠組みをつくる。

教育分野は当面、小学校から高校までの初等中等教育段階を対象とする。ビジョンペーパーは、児童生徒がAIを擬人化して情緒的に依存するリスクなど4つを例示した。

「どこまで対応すれば安全か」が決まっていない

AISIは、AIの安全性に関する評価手法や基準を検討する政府の機関である。2023年12月21日のAI戦略会議で当時の岸田総理大臣が設立を表明し、2024年2月14日に情報処理推進機構(IPA)に事務局を置いて発足した。所長は村上明子氏(非常勤)。「統合イノベーション戦略2024」(2024年6月4日閣議決定)で、AIの安全性に関する中心的機関としてIPAに設置すると位置づけられている。

事業実証ワーキンググループは、2025年3月に始まった「AI利活用促進に向けたAIセーフティ評価に関する事業実証」の推進体制で、ビジョンペーパーの初版は2025年6月30日に公開された。今回が初めての改訂になる。

ビジョンペーパーが出発点に置いているのは、リスクの判断指標が決まっていないという問題だ。生成AIの利活用では、誤情報の出力、ハルシネーション(もっともらしい嘘)、プロンプトインジェクションによるセキュリティ侵害、個人情報の漏えいといったリスクが現に起きている。ところが、そのリスクに「どの程度対応すればよいのか」「受容可能なリスクのレベルとは何か」を示す指標(メルクマール)がない。開発する側も導入する側も、安全だと言い切る根拠を持てないままAIを使っているのが現状である。

そこで分野ごとに「誰が、何の目的で、どう使うか」まで降りて評価の観点を整理する。想定読者は、AIを開発・提供する事業者、AIを導入する企業・自治体、そして政策担当者・認証機関の3者としている。

部会は、分野別の4つ(ヘルスケア、ロボティクス、教育、ジオAI)と、分野をまたぐ2つ(データ品質、適合性評価)という構成だ。分野別は「国際的関心が高く日本が強みを持つ分野」を選んだとしており、分野横断は日本発の評価枠組みを国際的なルール形成につなげる役回りを担う。

学校の生成AI、挙がったリスクは4つ

新設された教育部会は、2026年度が活動の初年度になる。評価の対象は、EdTech事業者などAI提供者が出すプロダクト・サービスで、教師が教材をつくったり児童生徒の状況を把握・評価したりする場面も検討に含める。

ビジョンペーパーが挙げたリスク例は4つある。

  • AIへの情緒的依存 — 児童生徒がAIを擬人化する傾向が、発達途上にある認知的・社会情動的な能力と相まって、チャットボットとのやりとりで依存や情緒的愛着、搾取を生む
  • 生産的な試行錯誤の喪失 — 生成AIへの過度な依存が、学習の進め方を自分で調整するメタ認知的な関与を弱める「メタ認知的怠惰」を招き、productive struggle(生産的な試行錯誤)の機会と学習者の主体性を失わせる
  • AI依存による成績低下 — AIの支援を受けて課題をこなせたことを自分の理解や能力によるものと誤認し、実際の習熟度を過大評価する。その結果、AI抜きで試験を受けると成績が下がる
  • プロンプトインジェクションによる評価操作 — 児童生徒が攻撃者としてふるまい、ふつうの提出物に見える文書へ悪意ある指示を埋め込んでモデルの挙動に影響を与え、自分に有利な評価を引き出す

10代が心身や将来の相談でAIに頼る傾向は、総務省の情報通信白書でも数字に表れている(10代の34.9%、心身や将来の相談を「AI中心」 ニュースを調べる場面の2倍超 60代の7倍 情報通信白書)。情緒的依存は、将来の話として挙げられているわけではない。

評価の進め方として、ビジョンペーパーは基盤モデル(LLM)だけを切り離して評価する方法を採らないとしている。教育分野では同じモデル・同じ出力でも、児童生徒の発達の段階や学習の目的によって影響の大きさと許容されるリスクが変わるためだ。ユースケースごとに、影響を受ける主体、望ましくない事象、その発生要因を整理してリスクシナリオを具体化し、既存のガードレールが効くかどうかを確かめる評価項目を組み立てる。ガイドやチェックリストの作成も視野に入れる。

学校現場向けの指針としては、文部科学省が「初等中等教育段階における生成AIの利活用に関するガイドライン(Ver.2.0)」を令和6年12月26日に公表している。2023年7月の暫定版を改訂したもので、基本的な考え方と留意事項を示す。ビジョンペーパーは、個別の学習場面ごとの評価シナリオ・評価項目・評価方法にはなお整理の余地があるとして、そこを埋めにいく位置づけを取る。

防災・都市計画を支える地理空間情報も対象に

もう一つの新設部会がジオAIである。防災、インフラ管理、都市計画などを支える地理空間情報をAIで整備・分析・推論する使い方が広がっているのに、その成果データの品質と信頼性を評価する手法が整っていない、という問題意識に立つ。

挙げられた課題は3つだ。AI活用を前提とした地理空間情報のデータ品質・信頼性の評価手法が未整備であること。AIによる分析・推論の結果をどれだけ信頼できるかを測る枠組みがないこと。そして地理空間の基盤モデル自体が、位相関係・空間参照・空間演算といった地理空間情報に特有の扱いを適切にこなせる段階まで来ていないことである。部会はユースケースに基づくリスク分析と評価のガイドラインを具体化し、国際標準化とルール形成につなげるとしている。

先行2分野はすでに評価観点ガイドを公表

先に立ち上がった2分野では、成果物が出ている。

ヘルスケア部会は2026年4月に「ヘルスケア領域におけるAIセーフティ評価観点ガイド」を公開した。対象は、医療機器や医療機器プログラムに該当しないテキスト生成AI(Non-SaMD)である。AIセーフティの10の評価観点をヘルスケア領域に当てはめてリスクを整理し、プロダクト開発の段階ごとに重要な評価項目をチェックリストにした。想定するリスクは、不正確な出力や不適切な応答が患者の生命・身体・精神に直接響くこと、要配慮個人情報などの機微なデータの漏えいや不適切な推論である。

ロボティクス部会は2026年7月に「AIロボティクスに関するセーフティ評価観点ガイド」を公開した。衝突・挟圧・転倒・誤動作といった物理的リスクに加え、威圧感やストレス、依存、判断の歪みといった心理的リスク、権利侵害・不正利用・不公平や差別的な扱いといった社会的リスクも抽出の対象に置く。従来の機能安全の考え方では捉えきれない範囲があるという整理で、「ロボットの種類×AI機能」のマトリクスで分類して評価する枠組みを示した。

AIの安全性評価そのものも、AISIは手を動かして試している。重みを公開したモデルの攻撃コード開発能力を実際に測った検証もその一つだ(重みが公開されたAI、攻撃コードの開発能力は「限定的」 IPAのAI安全機関が評価 16点満点の平均はGLM-5.2が2.80、Claude Opus 4.8は5.22)。

分野横断の2部会のうち、データ品質部会は「データ品質マネジメントガイドブック」の更新と評価ツールの提供、データ品質を共通の基準で比べる「評価尺度(メジャー)」の整備を進める。適合性評価部会は、国際標準化が進むISO/IEC 42007の枠組みを踏まえ、事業者による自己適合評価を含む評価手法と運用手順の確立、制度設計を目指す。

ロードマップでは、2026年度から2027年度を中期の取り組み期間とし、評価手法の精緻化と評価環境の整備、AIエージェントシステムへの対応、分野をまたいだ評価基盤の共通インフラ化、国際標準との整合を挙げた。その先の長期の目標には、汎用人工知能(AGI)を見据えた評価基盤の高度化を置いている。