Skip to main content
QUICK REVIEW

[논문 리뷰] Predicting Credit Risk for Unsecured Lending: A Machine Learning Approach

Kevin Naik|arXiv (Cornell University)|2021. 10. 05.
Financial Distress and Bankruptcy Prediction참고 문헌 13인용 수 4
한 줄 요약

이 논문은 불균형한 신용카드 데이터셋을 사용하여 무담보 대출의 신용 리스크를 예측하기 위한 기계학습 접근법을 제안한다. SMOTE를 적용한 후 LGBM 분류기가 여섯 개의 다른 모델보다 뛰어난 성능을 보였으며, 정확도 95.53%와 AUC 0.99를 기록하여 신용 불이행을 탐지하는 데 뛰어난 성능을 입증하였다.

ABSTRACT

Since the 1990s, there have been significant advances in the technology space and the e-Commerce area, leading to an exponential increase in demand for cashless payment solutions. This has led to increased demand for credit cards, bringing along with it the possibility of higher credit defaults and hence higher delinquency rates, over a period of time. The purpose of this research paper is to build a contemporary credit scoring model to forecast credit defaults for unsecured lending (credit cards), by employing machine learning techniques. As much of the customer payments data available to lenders, for forecasting Credit defaults, is imbalanced (skewed), on account of a limited subset of default instances, this poses a challenge for predictive modelling. In this research, this challenge is addressed by deploying Synthetic Minority Oversampling Technique (SMOTE), a proven technique to iron out such imbalances, from a given dataset. On running the research dataset through seven different machine learning models, the results indicate that the Light Gradient Boosting Machine (LGBM) Classifier model outperforms the other six classification techniques. Thus, our research indicates that the LGBM classifier model is better equipped to deliver higher learning speeds, better efficiencies and manage larger data volumes. We expect that deployment of this model will enable better and timely prediction of credit defaults for decision-makers in commercial lending institutions and banks.

연구 동기 및 목표

  • 기계학습을 활용하여 무담보 대출에 대한 강력한 신용 스코링 모델을 개발하여 불이행 예측을 향상시키기.
  • 불이행 사례가 희귀한 신용카드 불이행 데이터셋에서의 데이터 불균형 문제를 해결하기.
  • 일곱 개의 기계학습 분류기의 성능을 평가하고 비교하기.
  • 실시간 상용 은행 및 대출 기관에 구현 가능한 가장 정확하고 효율적인 모델을 식별하기.
  • 대규모 데이터셋에서 일반화 및 확장성을 향상시키기 위해 모델의 하이퍼파라미터를 최적화하기.

제안 방법

  • 불균형한 신용카드 불이행 데이터셋을 보정하기 위해 합성 少수 클래스 오버샘플링 기법(SMOTE)을 적용하여 소수 클래스의 합성 샘플을 생성하였다.
  • 일곱 개의 기계학습 분류기(로지스틱 회귀, SVM, KNN, 결정 트리, 랜덤 포레스트, XGBoost, LGBM)를 훈련하고 평가하였다.
  • 모델 성능을 비교하기 위해 AUC(Receiver Operating Characteristic 곡선 아래 면적)과 정확도 스코어를 주요 평가 지표로 사용하였다.
  • 모델 효율성 향상과 과적합 방지를 위해 LGBM의 하이퍼파라미터 최적화를 위해 max_depth, learning_rate, num_leaves를 조정하였다.
  • 레벨별 접근 방식에 비해 훈련 속도와 정확도를 향상시키기 위해 LGBM에 잎 기반 트리 성장 전략을 구현하였다.
  • 고객의 개인 정보 및 신용 이력 데이터를 기반으로 특성 공학을 수행하여 모델 훈련 및 평가에 사용할 입력 데이터를 준비하였다.

실험 결과

연구 질문

  • RQ1불균형 데이터를 가진 무담보 대출에서 신용 불이행을 예측하는 데 가장 우수한 기계학습 모델은 무엇인가?
  • RQ2SMOTE는 극도로 편향된 신용 불이행 데이터셋에서 모델 성능 향상에 얼마나 효과적인가?
  • RQ3LGBM은 기존 기울기 부스팅 및 전통적 분류기들과 비교해 신용 리스크 예측에서 상대적으로 어떤 성능을 보이는가?
  • RQ4메모리 사용량이 제한된 환경에서 LGBM은 대규모 신용카드 데이터셋에서도 높은 정확도와 효율성을 달성할 수 있는가?
  • RQ5실제 은행 응용 프로그램에서 신용 리스크 모델링을 위한 LGBM 성능을 최적화하는 데 적합한 하이퍼파라미터 설정은 무엇인가?

주요 결과

  • LGBM 분류기가 95.53%의 최고 정확도 스코어를 기록하여 테스트된 모든 다른 모델보다 뚜렷이 뛰어난 성능을 보였다.
  • LGBM은 AUC 0.99를 기록하여 불이행자와 비불이행자 간의 분류 능력이 뛰어나다는 것을 나타내었다.
  • XGBoost는 정확도 91.96%로 두 번째로 높은 성능을 보였으며 AUC도 LGBM에 근접했지만, LGBM은 훈련 속도와 메모리 효율성에서 뛰어난 성능을 보였다.
  • SMOTE 기법은 데이터 불균형 문제를 효과적으로 완화하여 희귀한 불이행 사례에 대한 학습 능력을 향상시켰다.
  • 평가된 모델들 중에서 LGBM은 대규모 신용 리스크 응용 분야에서 속도, 정확도, 확장성의 최적의 균형을 보였다.
  • max_depth, learning_rate, num_leaves의 하이퍼파라미터 최적화를 통해 LGBM의 성능이 더욱 향상되었고 과적합도 감소시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.