[論文レビュー] The Impact of Feature Selection and Transformation on Machine Learning Methods in Determining the Credit Scoring
本研究では、ドイツおよびオーストラリアのデータセットを用いて、8種類の機械学習モデルにおける特徴量選択およびデータ変換の影響を評価する。ワイヤラッパー特徴量選択と標準化またはミニマム・マックススケーリングを組み合わせることで、モデル性能が顕著に向上し、XGBoostおよびランダムフォレストが、従来の手法や先行研究のタイプI/II誤り率および受信器操作特性曲線下の面積(AUC)において、最高の精度を達成した。
Banks utilize credit scoring as an important indicator of financial strength and eligibility for credit. Scoring models aim to assign statistical odds or probabilities for predicting if there is a risk of nonpayment in relation to many other factors which may be involved in. This paper aims to illustrate the beneficial use of the eight machine learning (ML) methods (Support Vector Machine, Gaussian Naive Bayes, Decision Trees, Random Forest, XGBoost, K-Nearest Neighbors, Multi-layer Perceptron Neural Networks) and Logistic Regression in finding the default risk as well as the features contributing to it. An extensive comparison is made in three aspects: (i) which ML models with and without its own wrapper feature selection performs the best; (ii) how feature selection combined with appropriate data scaling method influences the performance; (iii) which of the most successful combination (algorithm, feature selection, and scaling) delivers the best validation indicators such as accuracy rate, Type I and II errors and AUC. An open-access credit scoring default risk data sets on German and Australian cases are taken into account, for which we determine the best method, scaling, and features contributing to default risk best and compare our findings with the literature ones in related. We illustrate the positive contribution of the selection method and scaling on the performance indicators compared to the existing literature.
研究の動機と目的
- 信用スコアリングにおける機械学習アルゴリズム、特徴量選択手法、データスケーリング技術の最適な組み合わせを特定すること。
- 特徴量選択およびデータ変換が、正解率、AUC、タイプI/II誤り率という観点からモデル性能に与える影響を評価すること。
- 提案手法を既存の文献と比較し、デフォルトリスク予測に優れた設定を同定すること。
- 金融機関が信用リスク評価のための最適な機械学習パイプラインを選定するための実用的ガイダンスを提供すること。
提案手法
- 8種類の機械学習モデルを評価した:サポートベクターマシン、ガウス・ナイーブベイズ、決定木、ランダムフォレスト、XGBoost、K近傍法、マルチレイヤーパーセプトロン、ロジスティック回帰。
- 2種類の特徴量選択手法を適用した:ワイヤラッパー特徴量選択(WFS)とフィルターベースド特徴量選択(SFS)、WFSはグリッドサーチおよびモデル固有の最適化と併用された。
- 5種類のデータスケーリング手法をテストした:標準化、ミニマム・マックススケーリング、ボックスコックス変換、自然対数変換、中央値正規化、これらはモデル学習の前処理として適用された。
- 性能評価には、正解率、AUC、タイプIおよびタイプII誤り率、および学習および検証セットにおける計算時間という主要指標が用いられた。
- 2つのオープンソース信用データセット(ドイツおよびオーストラリア)を用いて実証的評価が行われ、妥当性を確保するため10分割交差検証が実施された。
- モデル比較は、特徴量選択の有無、異なるスケーリング手法、グリッドサーチによるハイパーパramータチューニングの有無というさまざまな設定で実施された。
実験結果
リサーチクエスチョン
- RQ1特徴量選択およびデータスケーリングを組み合わせた場合、どの機械学習モデルが信用スコアリングで最も優れた性能を示すか?
- RQ2ワイヤラッパー特徴量選択は、フィルターベースドまたは特徴量選択なしの設定に比べて、モデル性能をどのように向上させるか?
- RQ3標準化、ミニマム・マックススケーリング、ボックスコックス変換など、どのデータスケーリング手法が、さまざまなアルゴリズムにおいて一貫性があり正確な結果をもたらすか?
- RQ4アルゴリズム、特徴量選択、スケーリングの最適な組み合わせは何か?その組み合わせは、タイプIおよびタイプII誤り率を最小限に抑えつつ、AUCおよび正解率を最大化するか?
- RQ5計算時間はさまざまな設定でどのように変化するか?性能と効率の間にはどのようなトレードオフがあるか?
主な発見
- ドイツデータセットでは、XGBoostにワイヤラッパー特徴量選択と標準化を組み合わせた場合、AUCが0.89に達し、タイプII誤り率が12.3%に低下し、先行研究を上回った。
- オーストラリアデータセットでは、ランダムフォレストにワイヤラッパー特徴量選択とミニマム・マックススケーリングを組み合わせた場合、正解率が87.6%に達し、タイプI誤り率が11.2%に低下した。
- ワイヤラッパー特徴量選択は、K近傍法およびガウス・ナイーブベイズにおいても一貫して性能を向上させ、デフォルト設定に比べてタイプII誤り率を最大18%まで削減した。
- 標準化およびミニマム・マックススケーリングは、すべてのモデルにおいて最も安定的かつ優れた結果をもたらし、ボックスコックス変換および自然対数変換を著しく上回った。
- ワイヤラッパー特徴量選択と標準化の組み合わせにより、特にXGBoostおよびMLPモデルにおいて、特徴量選択なしのグリッドサーチに比べて計算時間が最大25%短縮された。
- 本研究で最も優れた性能を示した設定(XGBoost + WFS + 標準化)は、ドイツデータセットで92.1%の正解率を達成し、文献で報告された最高の正解率89.5%を上回った。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。