この記事で分かること

  • モデルドリフトとは何か。「モデルは変わっていないのに現実が変わる」ことで起きる劣化であること
  • データドリフトとコンセプトドリフトという2つの型の違いと、なぜ後者ほど発見が遅れやすいのか
  • 外部提供モデルが提供者側で更新されるという、生成AI特有の事情
  • 整数設例で見る、正答率の低下と分布変化の検知タイミングのずれ

30秒で分かる定義

モデルドリフトとは、モデル自体には変更を加えていないにもかかわらず、モデルが前提とする現実の側(入力データの傾向や、入力と結果の関係)が変化することで、時間の経過とともにモデルの性能が劣化していく現象をいいます。英語では Model Drift(読み方:もでるどりふと)と呼ばれ、モデル劣化・モデル陳腐化といった表現でも言い換えられます。モデル・リスクの一類型として位置づけられ、モデルを作った時点では適切に機能していたモデルであっても、環境が変われば使用を続けること自体がリスクになり得るという考え方が背景にあります。

なぜファイナンス実務で重要なのか

与信スコアリング、不正検知、需要予測、価格モデルなど、ファイナンス実務で使われるモデルの多くは、過去のデータから学習した関係性が将来も続くという前提の上に成り立っています。しかし金利環境、景気局面、顧客構成、規制は常に変化するため、この前提はいずれ崩れます。検証を導入時の1回で終わらせて放置すれば、いつの間にか誤った判断根拠になり得ます。特に与信判断や引当計上のように意思決定に直結する用途では、劣化に気づかないまま運用を続けることが実害につながるため、継続的な性能確認はモデル・リスク管理の中核的な実務の一つです。

仕組み:2つの型を区別する

モデルドリフトは、何が変化しているかによって大きく2つの型に分けて理解するのが実務上の基本です。

型何が変わるか具体例
データドリフト入力データの分布顧客構成が変わった、新しい商品区分が増えた、入力される書式が変わった
コンセプトドリフト入力と結果の関係そのもの金利環境が変わり、同じ財務指標の水準でもデフォルト率が変わる

データドリフトは、入力の分布を継続的に監視していれば比較的検知しやすい変化です。一方コンセプトドリフトは、入力の見た目は以前と変わらないのに、モデルが学習した「入力から結果を導く関係式」そのものが現実とずれていくため、出力の性能を実測するまで気づきにくく、発見が遅れやすい傾向があります。発見が遅れる分だけ誤った判断が積み重なりやすく、両者は同時並行で起きることも多いため、片方だけの監視では見落としが生じます。

整数設例で確認する

架空の設例。ある与信スコアリングモデルを導入し、導入直後に1,000件を判定したところ、実際の与信結果(デフォルトの有無)とモデルの予測が一致した件数は920件でした。正答率は 920 ÷ 1,000 = 92.0%です。

このとき審査対象の業種構成は、製造業450件(45%)、小売業350件(35%)、サービス業200件(20%)でした(450+350+200=1,000件、45%+35%+20%=100%で検算一致)。

6か月後、同じモデルで別の1,000件を審査したところ、業種構成は製造業380件(38%)、小売業520件(52%)、サービス業100件(10%)に変化していました(380+520+100=1,000件、38%+52%+10%=100%で検算一致)。小売業の比率が35%→52%へ、17ポイント上昇しています。この時点ではまだ正答率の低下は確認されておらず、入力データの分布変化(データドリフトの兆候)が先に数値として現れていたことになります。

さらに6か月後(導入から12か月後)、あらためて1,000件で正答率を測定したところ、一致件数は828件に低下していました。正答率は 828 ÷ 1,000 = 82.8%で、導入時の92.0%から9.2ポイントの低下です(92.0% - 82.8% = 9.2ポイント、検算一致)。この設例では、業種構成の変化(データドリフト)が先に観測され、その後に正答率の低下(コンセプトドリフトを含む複合的な劣化)が確認されており、分布の変化を先行指標として監視する意味を数値で示しています。

生成AIに固有の事情

自社で開発・学習させたモデルであれば、中身が変わるのは自社が変更を加えたときだけです。しかし外部の生成AIサービスを組み込んで使う場合は事情が異なります。提供者側でモデルが更新されることがあり、自社側では何も変更していないのに出力の傾向が変わることがあります。モデルの版数(バージョン)、性能、料金体系は提供者により異なり変動も速いため本記事では立ち入りませんが、実務上は提供者による更新も広い意味でのモデルドリフトの一種として扱う必要があります。使用モデルの版数を記録し、更新のタイミングで出力の性能をあらためて評価し直すことが基本的な運用になります。

実務での使い方

  • 出力の性能を一時点の検証で終わらせず、継続的に測定する仕組みを用意する。正解データとの突き合わせや、業務側からの苦情・差し戻し件数の推移を用いる
  • 入力データの分布(顧客構成、商品区分など)を定期的に集計し、導入時点の分布と比較する。分布変化はコンセプトドリフトより先に現れやすく、早期の警告として活用できる
  • 生成AIを組み込んでいる場合は、生成AIのモデルリスク管理にある台帳管理・変更時の再評価の仕組みを参考にする
  • 継続的な性能測定の設計自体を、評価セットや採点基準の設計と同様の考え方で仕組み化する
  • AIの出力をそのまま正しいものとして扱わず、測定結果自体が異常でないかも検証する(測定の集計ミスや母集団の取り違えがないかを確認する)

実務家が確認するポイントとよくある誤解

誤解1:「精度の高いモデルを作れば、その後は安定して使い続けられる」→ 誤りです。導入時点の精度が高くても、環境が変われば性能は低下し得ます。継続監視は精度の高さとは別の実務課題です。

誤解2:「入力データの分布さえ監視していればよい」→ それだけでは、入力と結果の関係が変わるコンセプトドリフトを見落とすことがあります。出力の性能そのものを測る仕組みが別途必要です。

確認ポイント:実務で最も多い失敗は「誰も気づかない」ことです。継続監視の担当者・頻度・閾値(どの程度の低下で対応するか)があらかじめ決まっているかが、最初に見るべき点になります。

日本実務での扱い

金融庁が公表している「モデル・リスク管理に関する原則」(令和3年11月12日公表)では、原則5として「継続モニタリング」が示されており、「モデルの使用開始後は、モデルが意図したとおりに機能していることを確認するために、第1線によって継続的にモニタリングされるべきである」とされています。また、外部提供のモデルを利用する場面については、原則7「ベンダー・モデル及び外部リソースの活用」が定められており、金融機関がベンダー・モデル等や外部リソースを活用する場合、それらの活用に対して適切な統制を行うべきとされています。生成AIのように提供者側で更新されるモデルを業務に組み込む場合、この原則7の考え方が参考になります。

なお、この原則の対象金融機関は、金融システム上重要な金融機関(G-SIBs・D-SIBs等)が想定されており、すべての事業会社に一律に適用されるものではありません。対象外の企業でも運用上の参考にはなりますが、自社への適用範囲や解釈は専門家への確認が必要です(2026年8月時点の公表資料に基づく)。

面接・実務で問われるポイント

Q:モデルドリフトとは何ですか。データドリフトとコンセプトドリフトの違いも説明してください。
「モデル自体は変えていないのに、現実の側が変わることでモデルの性能が劣化していく現象です。入力データの分布が変わるデータドリフトと、入力と結果の関係そのものが変わるコンセプトドリフトに分けられます。後者は入力の見た目が変わらないため出力の性能を実測するまで気づきにくく、発見が遅れやすい点が実務上の注意点です。」

深掘りでは「どうやって検知するか」が問われます。出力の性能を継続測定する仕組みと、入力分布の監視を両輪で持つ必要があることまで説明できるかが分かれ目です。

よくある質問(FAQ)

Q. モデルドリフトが起きたら、どう対応すればよいですか。
A. まず継続監視で低下や変化を検知し、原因がデータドリフトかコンセプトドリフトか(あるいは両方か)を切り分けます。その上で、モデルの再学習・パラメータの見直し・使用の一時停止など、原因に応じた対応を検討する流れが一般的です。個別の対応方法はモデルの用途とリスクの大きさによって異なります。

Q. 外部の生成AIサービスを使っている場合、自社でモデルドリフトを管理する必要がありますか。
A. 提供者側の更新は自社でコントロールできませんが、使用しているモデルの版数を記録し、更新の前後で出力の性能を比較する、といった管理は自社側の実務として必要になります。機械学習の一般的な仕組みはファイナンスのための機械学習入門で確認できます。

出典・参考(2026-08-16確認)

共有: