Skip to main content
QUICK REVIEW

[論文レビュー] Towards Global Explanations for Credit Risk Scoring

Irene Unceta, Jordi Nin|arXiv (Cornell University)|Nov 19, 2018
Explainable Artificial Intelligence (XAI)参考文献 7被引用数 10
ひとこと要約

この論文は、ブラックボックス信用リスクモデルの意思決定関数をサンプリングすることで、解釈可能でグローバルな説明を生成するモデルに依存しないコピーフレームワークを提案する。このアプローチは、解釈可能性と分解可能性を保ちつつ、最高で79%の高い精度を達成し、事前処理を必要とせず、性能の低下なしに規制適合性と特徴量の重要度分析の向上を可能にする。

ABSTRACT

In this paper we propose a method to obtain global explanations for trained black-box classifiers by sampling their decision function to learn alternative interpretable models. The envisaged approach provides a unified solution to approximate non-linear decision boundaries with simpler classifiers while retaining the original classification accuracy. We use a private residential mortgage default dataset as a use case to illustrate the feasibility of this approach to ensure the decomposability of attributes during pre-processing.

研究の動機と目的

  • 信用リスクスコアリングモデルにおける高い予測精度と解釈可能性の間の葛藤を解消すること。
  • モデルの分解可能性と規制適合性を損なう事前処理ステップの制限を克服すること。
  • ローカルまたは後処理型の説明に依存せずに、ブラックボックス分類器のグローバルで解釈可能な説明を生成する手法を開発すること。
  • 複雑なモデルに代わる単純で正確な解釈可能なコピーを用いることで、規制適合性で高い性能を発揮する信用スコアリングを実現すること。
  • 非分解可能な特徴量工学を避けて、生の属性から直接学習することで、特徴量の重要度の明確さを維持すること。

提案手法

  • 元の特徴空間から合成データポイントをサンプリングし、元のモデルの予測でラベル付けされた合成データセットを生成する。
  • 元のモデルの意思決定関数を模倣するように、合成データセット上でコピーモデル(例:決定木やロジスティック回帰)を訓練する。
  • 正則化やハイパーパrameterチューニングを回避することで、モデル容量を保ちながら、制約なしの経験的リスク最小化によりコピーモデルを最適化する。
  • コピーモデルを元のモデルの行動を再現するサーヴェイゲートとして用い、生の入力特徴量上でグローバルな解釈可能性を保証する。
  • 無限の合成データストリームを活用することで、一般化誤差を漸近的に低減し、コピーモデルの一般化性能を高める。
  • 標準的な学習手法とは対照的に、正則化を避け、性能の低下を防ぐためにモデル容量を優先する。

実験結果

リサーチクエスチョン

  • RQ1高精度なブラックボックス信用リスクモデルの意思決定境界を説明するグローバルで解釈可能なサロゲートモデルを構築できるか?
  • RQ2コピングプロセスは、精度を保ちながら解釈可能性と規制適合性を確保できるか?
  • RQ3最適化と一般化の観点から、コピングと標準的な機械学習の根本的な違いは何か?
  • RQ4コピングフレームワークは、信用リスクモデリングにおける非分解可能な事前処理の必要性を排除できるか?
  • RQ5精度と特徴量の重要度の一貫性の観点から、コピーモデルの性能は元のブラックボックスモデルと比べてどの程度か?

主な発見

  • 勾配ブースティング木モデル(元の精度79%)をコピーする際、オリジナルのテストデータ上で平均精度0.739 ± 0.018を達成した。
  • コピーモデルは元のモデルと特徴量の重要度順位で高い一致を示し、特徴量間の識別能が向上した傾斜のある分布を示した。
  • 分解可能性のシナリオでは、コピーモデルはオリジナルのテストデータ上で71%(±4%)の精度を達成し、77%の精度を示す事前処理済みのロジスティック回帰パイプラインを置き換えた。
  • 非線形的で解釈不能な勾配ブースティング木を、生の特徴量に直接作用する決定木に置き換えることに成功し、性能と解釈可能性を両立した。
  • 非分解可能な特徴量工学の必要性が排除され、元のデータ属性に基づく説明が可能になった。
  • 本研究では、コピングにおける誤差の主な要因を有限な合成データと高次元特徴空間における不十分な探索と特定し、今後の研究として最適な合成データ生成法の開発が提案された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。