Skip to main content
QUICK REVIEW

[論文レビュー] Predicting Credit Risk for Unsecured Lending: A Machine Learning Approach

Kevin Naik|arXiv (Cornell University)|Oct 5, 2021
Financial Distress and Bankruptcy Prediction参考文献 13被引用数 4
ひとこと要約

本論文では、不均衡なクレジットカードデータセットを用いて、LGBM分類器を用いた機械学習的手法により、無担保ローンの信用リスクを予測する手法を提案している。クラスの不均衡に対処するためにSMOTEを適用した後、LGBMは他の6つのモデルを上回り、95.53%の正確性とAUC 0.99を達成し、信用违约の検出において優れた性能を示した。

ABSTRACT

Since the 1990s, there have been significant advances in the technology space and the e-Commerce area, leading to an exponential increase in demand for cashless payment solutions. This has led to increased demand for credit cards, bringing along with it the possibility of higher credit defaults and hence higher delinquency rates, over a period of time. The purpose of this research paper is to build a contemporary credit scoring model to forecast credit defaults for unsecured lending (credit cards), by employing machine learning techniques. As much of the customer payments data available to lenders, for forecasting Credit defaults, is imbalanced (skewed), on account of a limited subset of default instances, this poses a challenge for predictive modelling. In this research, this challenge is addressed by deploying Synthetic Minority Oversampling Technique (SMOTE), a proven technique to iron out such imbalances, from a given dataset. On running the research dataset through seven different machine learning models, the results indicate that the Light Gradient Boosting Machine (LGBM) Classifier model outperforms the other six classification techniques. Thus, our research indicates that the LGBM classifier model is better equipped to deliver higher learning speeds, better efficiencies and manage larger data volumes. We expect that deployment of this model will enable better and timely prediction of credit defaults for decision-makers in commercial lending institutions and banks.

研究の動機と目的

  • 機械学習を用いて、信用違約の予測を改善する、無担保ローン向けの頑健な信用スコアリングモデルの構築を目的とする。
  • デフォルト件数が少ないという特徴を持つクレジットカード違約データセットにおけるデータの不均衡問題に対処することを目的とする。
  • 信用リスクを予測する7つの機械学習分類器の性能を評価および比較することを目的とする。
  • 商業銀行および貸金機関におけるリアルタイム導入に適した、最も正確で効率的なモデルの特定を目的とする。
  • 一般化性能と大規模データセットへのスケーラビリティを向上させるために、モデルのハイパーパrameterを最適化することを目的とする。

提案手法

  • クラスの不均衡を解消するために、少数クラスのサンプルを合成的に生成するための、合成少数オーバーサンプリング技術(SMOTE)を適用した。
  • ロジスティック回帰、SVM、KNN、決定木、ランダムフォレスト、XGBoost、LGBMの7つの機械学習分類器を訓練および評価した。
  • モデルの性能を比較するために、受信者操作特性曲線下の面積(AUC)と正確性スコアを主な評価指標として用いた。
  • LGBMの効率性を最適化し、過学習を低減するために、max_depth、learning_rate、num_leavesのハイパーパrameterチューニングを実施した。
  • レベルワイズアプローチと比較して、訓練速度と精度を向上させるために、LGBMでリーフワイズツリー成長戦略を採用した。
  • 顧客の個人情報および信用履歴データを特徴工学的に処理し、モデルの訓練および評価の入力として準備した。

実験結果

リサーチクエスチョン

  • RQ1不均衡なデータを有する無担保ローンの信用違約を予測する際、どの機械学習モデルが最も優れた性能を示すか?
  • RQ2SMOTEは、極めて歪んだ信用違約データセットにおいて、モデルの性能を向上させるのにどの程度効果的か?
  • RQ3LGBMは、他の勾配ブースティングおよび従来の分類器と比較して、信用リスク予測において相対的にどの程度の性能を示すか?
  • RQ4LGBMは、メモリ使用量が限られた環境下でも、大規模なクレジットカードデータセットに対して高い正確性と効率性を達成できるか?
  • RQ5実際の銀行業務応用における信用リスクモデリングにおいて、LGBMの性能を最適化するためのハイパーパrameter設定は何か?

主な発見

  • LGBM分類器は、95.53%の最高の正確性スコアを記録し、テストされたすべての他のモデルを顕著に上回った。
  • LGBMはAUC 0.99を記録し、デフォルトと非デフォルトのケースを優れた能力で区別できることを示した。
  • XGBoostは2番目に高い正確性(91.96%)を記録し、AUCもLGBMに近く、しかしLGBMは訓練速度とメモリ効率の面で優れた性能を示した。
  • SMOTE技術は、データの不均衡を効果的に緩和し、レアなデフォルトケースからの学習を促進した。
  • 評価されたモデルの中で、LGBMは大規模な信用リスク応用に適した、速度、正確性、スケーラビリティのバランスが最良であった。
  • max_depth、learning_rate、num_leavesのハイパーパrameterチューニングにより、LGBMの性能がさらに向上し、過学習のリスクも低減された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。