Skip to main content
QUICK REVIEW

[논문 리뷰] The Impact of Feature Selection and Transformation on Machine Learning Methods in Determining the Credit Scoring

Oguz Koc, Ömür Uğur|arXiv (Cornell University)|2023. 03. 09.
Financial Distress and Bankruptcy PredictionBusiness, Management and Accounting인용 수 3
한 줄 요약

이 연구는 독일 및 호주 데이터셋을 사용하여 신용 평가를 위한 여덟 가지 기계 학습 모델에 대한 기능 선택 및 데이터 변환의 영향을 평가한다. 워퍼 기반 기능 선택과 표준 또는 최소-최대 스케일링을 조합한 것이 모델 성능을 크게 향상시키며, XGBoost와 랜덤 포레스트가 정확도와 AUC에서 가장 높은 성능을 보이며 기존의 전통적 방법과 이전 문헌의 유형 I/II 오류 비율 및 ROC 곡선 아래 면적에서 뛰어난 성능을 보였다.

ABSTRACT

Banks utilize credit scoring as an important indicator of financial strength and eligibility for credit. Scoring models aim to assign statistical odds or probabilities for predicting if there is a risk of nonpayment in relation to many other factors which may be involved in. This paper aims to illustrate the beneficial use of the eight machine learning (ML) methods (Support Vector Machine, Gaussian Naive Bayes, Decision Trees, Random Forest, XGBoost, K-Nearest Neighbors, Multi-layer Perceptron Neural Networks) and Logistic Regression in finding the default risk as well as the features contributing to it. An extensive comparison is made in three aspects: (i) which ML models with and without its own wrapper feature selection performs the best; (ii) how feature selection combined with appropriate data scaling method influences the performance; (iii) which of the most successful combination (algorithm, feature selection, and scaling) delivers the best validation indicators such as accuracy rate, Type I and II errors and AUC. An open-access credit scoring default risk data sets on German and Australian cases are taken into account, for which we determine the best method, scaling, and features contributing to default risk best and compare our findings with the literature ones in related. We illustrate the positive contribution of the selection method and scaling on the performance indicators compared to the existing literature.

연구 동기 및 목표

  • 신용 평가를 위한 기계 학습 알고리즘, 기능 선택 방법, 데이터 스케일링 기법의 최적 조합을 규명하기 위해.
  • 기능 선택 및 데이터 변환의 영향을 정확도, AUC, 유형 I/II 오류 비율 측면에서 모델 성능에 미치는 영향을 평가하기 위해.
  • 제안된 방법론을 기존 문헌과 비교하여 기본 위험 예측에 대해 뛰어난 구성 요소를 규명하기 위해.
  • 금융 기관이 신용 리스크 평가를 위한 최적의 기계 학습 파ip라인을 선택하는 데 실용적인 지침을 제공하기 위해.

제안 방법

  • 여덟 가지 기계 학습 모델을 평가함: 서포트 벡터 머신, 가우시안 나이브 베이즈, 결정 트리, 랜덤 포레스트, XGBoost, K-최근접 이웃, 다층 퍼셉트론, 로지스틱 회귀.
  • 두 가지 기능 선택 방법을 적용함: 워퍼 기반(WFS) 및 필터 기반(SFS), WFS는 격자 검색 및 모델 전용 최적화와 함께 사용됨.
  • 다섯 가지 데이터 스케일링 기법을 시험함: 표준, 최소-최대, 박스-콕스, 자연 로그, 중앙값 정규화, 모델 학습 이전에 적용됨.
  • 성능 평가를 위해 정확도, AUC, 유형 I 및 유형 II 오류 비율, 학습 및 검증 세트에서의 계산 시간을 포함한 핵심 지표를 사용함.
  • 두 개의 오픈소스 신용 데이터셋(독일 및 호주)을 사용하여 실증 평가를 수행하였으며, 강건성을 확보하기 위해 10겹 교차 검증을 실시함.
  • 다양한 구성 조건에서 모델 비교를 수행함: 기능 선택 유무, 다양한 스케일링 방법, 격자 검색 하이퍼파rameter 튜닝 유무

실험 결과

연구 질문

  • RQ1기능 선택 및 데이터 스케일링을 통합했을 때, 어떤 기계 학습 모델이 신용 평가에서 가장 우수한 성능을 보이는가?
  • RQ2워퍼 기반 기능 선택이 필터 기반 또는 기능 선택 없음과 비교해 성능 향상에 얼마나 기여하는가?
  • RQ3표준, 최소-최대, 박스-콕스 등 다양한 데이터 스케일링 방법 중 어느 것이 다양한 알고리즘에 걸쳐 가장 일관되고 정확한 결과를 제공하는가?
  • RQ4유형 I 및 유형 II 오류를 최소화하면서 AUC와 정확도를 최대화하는 최적의 알고리즘, 기능 선택, 스케일링 조합은 무엇인가?
  • RQ5계산 시간은 다양한 구성 조건에서 어떻게 달라지며, 성능과 효율성 사이의 상충 관계는 어떠한가?

주요 결과

  • XGBoost에 워퍼 기반 기능 선택과 표준 스케일링을 적용한 결과 독일 데이터셋에서 최고의 AUC(0.89)와 가장 낮은 유형 II 오류 비율(12.3%)을 기록하였으며, 이는 이전 연구를 초월한 성능이었다.
  • 랜덤 포레스트에 워퍼 기반 기능 선택과 최소-최대 스케일링을 적용한 결과 호주 데이터셋에서 최고의 정확도(87.6%)와 가장 낮은 유형 I 오류(11.2%)를 기록하였다.
  • 워퍼 기반 기능 선택은 K-최근접 이웃과 가우시안 나이브 베이즈에 대해 일관되게 성능 향상을 이끌었으며, 기본 설정 대비 유형 II 오류를 최대 18%까지 감소시켰다.
  • 표준 스케일링과 최소-최대 스케일링 방법이 모든 모델에서 가장 안정적이고 뛰어난 결과를 보였으며, 박스-콕스 및 자연 로그 변환보다 뚜렷이 우수한 성능을 보였다.
  • 워퍼 기반 기능 선택과 표준 스케일링의 조합은 XGBoost 및 MLP 모델에서 기능 선택 없이 격자 검색을 수행한 경우 대비 최대 25%의 계산 시간 단축을 이끌었다.
  • 이 연구에서 가장 뛰어난 성능을 보인 구성(표준 스케일링 + XGBoost + WFS)은 독일 데이터셋에서 92.1%의 정확도를 기록하였으며, 문헌에 보고된 최고의 정확도인 89.5%를 초월하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.