Skip to main content
QUICK REVIEW

[論文レビュー] Improving a Credit Scoring Model by Incorporating Bank Statement Derived Features

Rory Bunker, Wenjun Zhang|arXiv (Cornell University)|Oct 30, 2016
Financial Distress and Bankruptcy Prediction参考文献 25被引用数 8
ひとこと要約

本研究では、新Zealandの貸金業者向けの信用スコアリングモデルを、申請書に記載されていなかった90日分の銀行明細から導出した5つの新規特徴量を組み込むことで改善した。Naive Bayes分類器に、従来の11の申請書特徴量に加え5つの銀行明細特徴量を統合したモデルは、AUCが0.791に達し、両方のベースラインモデルを上回り、銀行明細データが、特に極めて不均衡なデータセットにおいて、信用リスク予測を顕著に向上させることを示した。

ABSTRACT

In this paper, we investigate the extent to which features derived from bank statements provided by loan applicants, and which are not declared on an application form, can enhance a credit scoring model for a New Zealand lending company. Exploring the potential of such information to improve credit scoring models in this manner has not been studied previously. We construct a baseline model based solely on the existing scoring features obtained from the loan application form, and a second baseline model based solely on the new bank statement-derived features. A combined feature model is then created by augmenting the application form features with the new bank statement derived features. Our experimental results using ROC analysis show that a combined feature model performs better than both of the two baseline models, and show that a number of the bank statement-derived features have value in improving the credit scoring model. The target data set used for modelling was highly imbalanced, and Naive Bayes was found to be the best performing model, and outperformed a number of other classifiers commonly used in credit scoring, suggesting its potential for future use on highly imbalanced data sets.

研究の動機と目的

  • 申請書に記載されていない銀行明細から導出された特徴量が、信用スコアリングモデルの性能を向上させるかどうかを評価すること。
  • 申請書の特徴量のみを用いたモデルと、銀行明細から導出された特徴量のみを用いたモデルの予測性能を比較すること。
  • 両方の特徴量タイプを統合した組み合わせモデルを構築し、信用リスク評価を改善するかどうかを評価すること。
  • Naive Bayesが極めて不均衡な信用スコアリングデータセットに適しているかどうかを評価すること。

提案手法

  • 11の既存の申請書特徴量のみを用いてベースラインモデルを構築した。
  • 90日分の銀行明細データから新たに導出された5つの特徴量のみを用いて、第二のベースラインモデルを構築した。
  • 両方の特徴量セットを統合し、16特徴量の単一モデルを評価対象とした。
  • 連続的な銀行明細特徴量をビンに変換するために、Fayyad & Iraniの離散化手法を適用した。
  • 特徴量エンコーディングの改善とモデルの解釈性向上を目的に、Weight of Evidence (WOE) 変換を用いた。
  • 複数の分類器をROC AUCを指標に評価し、その中でNaive Bayesが最も優れた性能を示したため、採用した。

実験結果

リサーチクエスチョン

  • RQ1申請書に記載されていない銀行明細から導出された特徴量は、信用スコアリングモデルの性能を向上させることができるか?
  • RQ2銀行明細特徴量のみを用いたモデルと、申請書特徴量のみを用いたモデルの予測力には、どのような差があるか?
  • RQ3従来の申請書特徴量と銀行明細特徴量を組み合わせることで、モデルの性能に顕著な向上が見られるか?
  • RQ4Naive Bayesは、極めて不均衡な信用スコアリングデータセットにおいて、実用的で効果的な分類器とみなせるか?

主な発見

  • 11の申請書特徴量と5つの銀行明細由来特徴量を統合した組み合わせ特徴量モデルは、AUCが0.791に達し、両方のベースラインモデルを上回った。
  • 申請書特徴量のみを用いたベースラインモデルのAUCは、銀行明細特徴量のみを用いたモデルよりも高かったため、後者単体では強力な予測が困難であることが示された。
  • Naive Bayes分類器は、特に極めて不均衡なデータに対して、他の一般的に用いられる分類器よりも優れた性能を示した。
  • 特に、特定のクレジットカードタイプを保有していることや、特定の金融機関と取引を行っていないことといった5つの銀行明細由来特徴量が、顕著なWeight of Evidence (WOE) 値を示し、予測的関連性が確認された。
  • 誤分類コスト比x=2(誤検出が誤未検出の2倍のコストを有する)の設定下で、真正陽性率は0.953に達し、7,401人の良好な申請者中7,059人を正しく分類した。
  • 本研究では、Naive Bayesが、特に不均衡データセットにおいて顕著な性能を示したため、信用スコアリング分野におけるさらなる検討が価値あるものであると示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。