国立情報学研究所の大規模言語モデル研究開発センター(LLMC)は9月28日、大規模言語モデル「LLM-jp-4.1」シリーズを公開した。今年4月から順次公開している「LLM-jp-4」シリーズの事後学習を作り直したもので、外部のプログラムやAPIを呼び出す「ツール呼び出し」に新たに対応した。モデル本体に加え、学習に使った事後学習データもあわせて公開する。
3つのモデルをApache 2.0で配布
公開されたのは3モデル。llm-jp-4.1-8b-thinkingが約86億パラメータの密結合(Dense)モデル、llm-jp-4.1-32b-a3b-thinkingが約320億パラメータのMixture of Experts(MoE)モデル、llm-jp-4.1-33b-thinkingが約332億パラメータのDenseモデルで、いずれもApache License 2.0のもとで配布される。同ライセンスは商用利用と改変を認めるもので、企業が自社のサービスに組み込むことも制約を受けにくい。
LLM-jpは、モデルの重みだけでなく学習データも出す方針を取っている。今回も、教師ありファインチューニング(SFT)のデータと、人の好みに合わせて調整する直接選好最適化(DPO)のデータを公開した。DPO用の選好データは8Bモデル用が305,831件、32B-A3Bモデル用が269,287件、33Bモデル用が89,023件である。
学習量は約3倍、回答の長さは5分の1に
事後学習の規模は大きく増えた。SFTのデータセットは約120億トークンで、これを3回繰り返して学習したため総学習量は約350億トークンになった。LLM-jp-4は約54億トークンを2回で約108億トークンだったので、今回は約3倍である。学習には米エヌビディアのGPU「H200 SXM5」を8基積んだ計算ノードを最大16ノード使い、8Bモデルは16ノードで約17時間、32B-A3Bモデルは8ノードで約49時間、33Bモデルは16ノードで約67時間を要した。会話ごとに注意機構の計算を切り分けるなどの最適化で、8Bモデルの学習速度は約2.7倍になったという。
もう一つの変更は回答の長さだ。前シリーズには聞かれていないことまで答えに詰め込む傾向があり、使い勝手を損なうだけでなく、不要な内容を生成することで事実と異なる出力を招く一因にもなっていた。そこで事後学習データを作る段階で「明示的に求められない限り、聞かれたことだけ答える」よう指示した。技術ブログによると「SFTとDPOの違いは?」という質問への最終回答は、LLM-jp-4と比べて約5分の1の長さになった。数学や科学の問題では従来どおり詳しい説明を残している。
ツール呼び出しへの対応では、エヌビディアが公開する学習データを加工した21,048件と、それを日本語訳した11,174件を学習データに足した。連続または並列で何段もツールを呼ぶ事例を優先して集めており、段数が5以上のデータは元データに1〜2%しかなかったという。この機能は、AIが外部のサービスを使って作業を進める仕組みの土台になる。政府共通の生成AI環境でも政府職員18万人の生成AI「源内」、10月ごろAIエージェント環境を導入へ 職員の業務手順を「スキル」にして省庁横断で共有 政府全体で1万〜数万件と見積もりという形で、同じ方向の整備が進んでいる。
「あなたは誰か」を直すと他社の知識が落ちた
技術ブログは、うまくいかなかった点も数字で示している。LLM-jpは事後学習データを作る際に外部のモデルを使っており、その出力には「私はChatGPTです」といった作り手由来の自己紹介が混じる。そこで自己紹介の記述を削除・書き換えるフィルターをかけたところ、「あなたはChatGPTですか」といった質問に正しく答えられた割合は24問中8問(33%)から23問(96%)へ上がった。
ところがその代わりに、別の指標が落ちた。「LLM-jpのCEOは誰か」のように存在しないものを尋ねる質問に誤って答えてしまう割合は26問中5問(19%)から14問(54%)へ悪化し、「GPT-4を開発したのはどこか」といった他社に関する知識の正答率は18問中17問(94%)から9問(50%)へ下がった。自分のことを正しく言えるようにする処理が、他社に関する一般知識まで壊していたことになる。
LLMCは一人称の自己紹介だけを書き換える改良版も試しており、そちらでは誤って答える割合が26問中2問(8%)、他社知識が18問中18問(100%)に戻ったが、自己認識は24問中16問(67%)に下がった。今回公開したモデルには改良前の版が入っており、フィルターの設計はまだ改善の余地があるとしている。国内の研究機関がサカナAI、今の生成AIとは別路線を探す研究集団「FIG」を公表 脳に学ぶ学習法で1000層の訓練に成功のように独自路線を模索する動きと並んで、うまくいかなかった実験を数字付きで出すこと自体が、公開モデルの価値の一部になっている。
ライセンスを理由に使わなかったデータ
性能面では、33Bモデルが評価ツール「swallow-evaluation-instruct」の平均スコアで既存のオープンモデルOlmo-3.1-32B-ThinkとQwen3-32Bを上回り、gpt-oss-120bとほぼ同等になった。一方でQwen3.8-27B、Gemma-4-31B-it、Muse-Glimmer-30Bには平均スコアでまだ差が残り、とくに数学と科学に改善の余地があるとしている。
数学の難問データセット「AIME」については、公開されている他モデルの学習データを使えばスコアが大きく伸びることを内部実験で確認したが、そのデータには他社モデルの出力を利用したものや、取得元サイトの利用規約との整合性に注意が要るものが含まれていたため使わなかったという。LLM-jpは学習データのライセンスを部分ごとに確認し、使えると判断したものだけを使う方針を取っている。数字を伸ばす近道をあえて外している点は、モデルを業務で使う側にとっては出所の追跡ができるという意味を持つ。
APIとチャットサービスは、東京大学が開発・運用する「mdx-MaaS」を通じて試験提供される。学術クラウド基盤mdx1のGPUを使い、主に研究者向けに10月中旬頃から段階的に募集を始める予定だ。LLMCは次期シリーズ「LLM-jp-4.2」の開発も進めており、学習データの拡充と強化学習の導入で推論能力とエージェント機能を高めるとしている。
