Skip to main content
QUICK REVIEW

[論文レビュー] Credit card score prediction using machine learning models: A new dataset

Anas Arram, Masri Ayob|arXiv (Cornell University)|Oct 4, 2023
Financial Distress and Bankruptcy Prediction被引用数 4
ひとこと要約

本研究では、米国銀行のデータをもとに新規のクレジットカードスコーリングデータセットを構築し、ロジスティック回帰、XGBoost、LightGBM、決定木、ランダムフォレスト、MLPを含む複数の機械学習モデルを用いて延滞予測を評価した。MLPモデルは最高の再現率(80%)とAUC(86.7%)を達成し、信用リスク評価における偽陰性を最小限に抑える観点で最良の性能を示した。

ABSTRACT

The use of credit cards has recently increased, creating an essential need for credit card assessment methods to minimize potential risks. This study investigates the utilization of machine learning (ML) models for credit card default prediction system. The main goal here is to investigate the best-performing ML model for new proposed credit card scoring dataset. This new dataset includes credit card transaction histories and customer profiles, is proposed and tested using a variety of machine learning algorithms, including logistic regression, decision trees, random forests, multi-layer perceptron (MLP) neural network, XGBoost, and LightGBM. To prepare the data for machine learning models, we perform data pre-processing, feature extraction, feature selection, and data balancing techniques. Experimental results demonstrate that MLP outperforms logistic regression, decision trees, random forests, LightGBM, and XGBoost in terms of predictive performance in true positive rate, achieving an impressive area under the curve (AUC) of 86.7% and an accuracy rate of 91.6%, with a recall rate exceeding 80%. These results indicate the superiority of MLP in predicting the default customers and assessing the potential risks. Furthermore, they help banks and other financial institutions in predicting loan defaults at an earlier stage.

研究の動機と目的

  • 延滞予測の向上を目的とした、取引履歴と顧客プロファイルを統合した包括的で新規のクレジットカードスコーリングデータセットの構築。
  • 偽陰性を最小限に抑えることを重視し、高い再現率を達成するように、多様な機械学習モデルの性能を評価すること。
  • 欠損値、外れ値、クラス不均衡といったデータ品質の問題に対して、体系的な前処理技術を用いて対処すること。
  • 再現率を他の指標よりも優先するという前提で、延滞の早期特定に最適な機械学習モデルを同定すること。
  • 金融機関が信用リスクを評価し、ローン延滞のリスクを低減するための堅牢でデータドリブンなツールを提供すること。

提案手法

  • 米国銀行のデータを収集・整備し、取引履歴と顧客の人口統計情報を統合した新規のクレジットカードスコーリングデータセットを構築した。
  • 特徴量抽出、欠損値への補完、IQRを用いた外れ値処理、クラスバランスのためのSMOTEを含む、データ前処理技術を適用した。
  • ロジスティック回帰、決定木、ランダムフォレスト、MLPニューラルネットワーク、XGBoost、LightGBMの6つの機械学習モデルを訓練・評価した。
  • 標準的な評価指標(正確性、AUC、適合率、再現率)を用い、再現率を主な性能指標として重視した。
  • ROC曲線を用いて、モデル間の識別能力を可視化した。
  • 再現率とAUCに基づき、最良の性能を示したモデルを選定し、適合率-再現率のトレードオフについても追加分析を行った。
Figure 1: Feed forward neural network structure [ 32 ]
Figure 1: Feed forward neural network structure [ 32 ]

実験結果

リサーチクエスチョン

  • RQ1新規に提示されたデータセットにおいて、どの機械学習モデルが延滞予測において最高の再現率を達成するか?
  • RQ2SMOTE や外れ値処理といった異なる前処理技術は、スコアリングモデルの性能にどのように影響するか?
  • RQ3代表的なモデル(例:ロジスティック回帰)と高度なモデル(例:MLP、LightGBM)の間で、延滞予測における性能に差は生じるか?
  • RQ4再現率を優先する状況において、深層学習モデル(例:MLP)は、木ベースのモデルを上回る性能を示せるか?
  • RQ5AUC、正確性、適合率、再現率といった主な指標において、モデルの性能はどのように変動するか?また、実世界の信用リスク評価において、最もバランスの取れた性能を示すモデルは何か?

主な発見

  • MLP分類器は、全モデルの中で最高の再現率(80%)を達成し、真の延滞者を特定する観点で最も効果的であった。
  • MLPモデルはAUCが86.7%を記録し、延滞者と非延滞者を良好に識別していることを示した。
  • LightGBMは最高の正確性(94.44%)とAUC(84.19%)を達成したが、MLPに比べ再現率が低い(70%)ことが判明した。
  • ランダムフォレストは高い正確性(93.06%)を示したが、再現率(75%)と適合率(75%)が低く、すべての正例を特定するという点で妥協が生じた。
  • ロジスティック回帰と決定木分類器は性能が低く、再現率はそれぞれ70%であり、AUCスコアも低かった。
  • ROC曲線分析により、MLPとランダムフォレストが左上隅に最も近い曲線を示し、延滞者を識別する観点で優れた全体的な性能を示していることが確認された。
Figure 2: The distribution of class labels
Figure 2: The distribution of class labels

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。