Skip to main content
QUICK REVIEW

[論文レビュー] Calibration of Machine Learning Classifiers for Probability of Default Modelling

Pedro G. Fonseca, Hugo Lopes|arXiv (Cornell University)|Oct 24, 2017
Advanced Data Processing Techniques被引用数 9
ひとこと要約

本論文は、信用スコアリングにおける機械学習分類器のキャリブレーション技術—プラットスケーリングと等方回帰—を評価し、デフォルト確率(PD)推定に焦点を当てる。18の実世界のデータセット(時系列として扱う)を用いて、等方回帰を用いた再キャリブレーションが長期的なキャリブレーションを顕著に改善することを示し、勾配ブースティングのような非パラメトリックモデルがバイアススコアロスにおいてロジスティック回帰を上回ることを明らかにした。

ABSTRACT

Binary classification is highly used in credit scoring in the estimation of probability of default. The validation of such predictive models is based both on rank ability, and also on calibration (i.e. how accurately the probabilities output by the model map to the observed probabilities). In this study we cover the current best practices regarding calibration for binary classification, and explore how different approaches yield different results on real world credit scoring data. The limitations of evaluating credit scoring models using only rank ability metrics are explored. A benchmark is run on 18 real world datasets, and results compared. The calibration techniques used are Platt Scaling and Isotonic Regression. Also, different machine learning models are used: Logistic Regression, Random Forest Classifiers, and Gradient Boosting Classifiers. Results show that when the dataset is treated as a time series, the use of re-calibration with Isotonic Regression is able to improve the long term calibration better than the alternative methods. Using re-calibration, the non-parametric models are able to outperform the Logistic Regression on Brier Score Loss.

研究の動機と目的

  • 信用スコアリングモデルの妥当性評価において、順位能力指標に依存するのみの限界を是正すること。
  • キャリブレーション技術が、PDモデリングにおける機械学習分類器の確率推定の正確性に与える影響を評価すること。
  • ロジスティック回帰、ランダムフォレスト、勾配ブースティング分類器の性能を、異なるキャリブレーション手法のもとでベンチマークすること。
  • データセットを時系列として扱った場合の、時間経過に伴う再キャリブレーションの影響を評価すること。
  • 適切に等方回帰を用いてキャリブレーションされた非パラメトリックモデルが、ロジスティック回帰を上回るかどうかを特定すること。

提案手法

  • 生のモデル出力を調整するためのポストプロセッシングキャリブレーション手法として、プラットスケーリングと等方回帰を採用する。
  • 各データセットを時系列として扱い、時間経過に伴う実世界のモデル展開を模擬し、定期的な再キャリブレーションを可能にする。
  • 長期的性能を評価するために、訓練セットと検証セットに別々にキャリブレーション手法を適用する。
  • キャリブレーション品質を評価する主な指標としてバイアススコアロスを用い、予測確率と実際の確率の差を測定する。
  • AUC(順位能力)とバイアススコアロス(キャリブレーション)の両方の指標を用いて、18の実世界の信用スコアリングデータセットにおけるモデル性能を比較する。
  • 非パラメトリックモデルとロジスティック回帰の両者に対するキャリブレーションの影響を体系的に評価するためのベンチマークフレームワークを実装する。

実験結果

リサーチクエスチョン

  • RQ1キャリブレーションは、PDモデリングにおける機械学習分類器の確率推定の長期的信頼性にどのように影響するか?
  • RQ2等方回帰による再キャリブレーションは、非パラメトリックモデルのバイアススコアロスをロジスティック回帰と比較して改善できるか?
  • RQ3順位能力指標(例:AUC)が、信用スコアリングモデルにおけるキャリブレーションの問題をどれほど誤魔化すか?
  • RQ4データセットを時系列として扱うことは、時間経過に伴うキャリブレートモデルの性能にどのように影響するか?
  • RQ5PD推定におけるモデルキャリブレーションの向上に関して、プラットスケーリングと等方回帰の比較的有効性はいかほどか?

主な発見

  • データセットを時系列として扱った場合、等方回帰による再キャリブレーションが長期的なキャリブレーション性能を顕著に改善することが分かった。
  • 等方回帰による再キャリブレーションを経た非パラメトリックモデル、特に勾配ブースティング分類器が、ロジスティック回帰よりも優れたバイアススコアロスを達成した。
  • 等方回帰のようなキャリブレーション技術は、特に動的な信用リスク環境において、確率推定の信頼性を高めるために不可欠である。
  • 順位能力指標(例:AUC)にのみ依存すると、悪いキャリブレーションが隠れ、モデル予測に対する過剰な自信を生むことがある。
  • 非線形的かつ複雑なデータ分布において、等方回帰はプラットスケーリングを上回り、時間経過に伴う正確な確率推定を維持する。
  • 18の実世界データセットに対するベンチマークにより、同様のAUC性能を示すにもかかわらず、キャリブレーションされた非パラメトリックモデルが、キャリブレーション指標において一貫してロジスティック回帰を上回ることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。