Skip to main content
QUICK REVIEW

[논문 리뷰] Improving a Credit Scoring Model by Incorporating Bank Statement Derived Features

Rory Bunker, Wenjun Zhang|arXiv (Cornell University)|2016. 10. 30.
Financial Distress and Bankruptcy Prediction참고 문헌 25인용 수 8
한 줄 요약

이 연구는 뉴질랜드 대출기관을 대상으로 기존 신용 평가 모델을 향상시키기 위해 90일 분기 은행 명세서에서 유도된 5개의 새로운 특징을 나이브 베이즈 분류기와 통합하였다. 기존 신청서에 기재되지 않은 특징들로 구성된 이 모델은 기존의 11개 응용 양식 특징과 함께 5개의 은행 명세서 특징을 포함하여 총 16개 특징을 사용하였으며, 최고의 AUC(0.791)를 기록하여 기준 모델들을 모두 앞섰다. 이는 은행 명세서 데이터가 특히 극도로 불균형한 데이터셋에서 신용 리스크 예측에 크게 기여한다는 것을 보여주며, 신용 평가 모델의 성능 향상에 기여한다.

ABSTRACT

In this paper, we investigate the extent to which features derived from bank statements provided by loan applicants, and which are not declared on an application form, can enhance a credit scoring model for a New Zealand lending company. Exploring the potential of such information to improve credit scoring models in this manner has not been studied previously. We construct a baseline model based solely on the existing scoring features obtained from the loan application form, and a second baseline model based solely on the new bank statement-derived features. A combined feature model is then created by augmenting the application form features with the new bank statement derived features. Our experimental results using ROC analysis show that a combined feature model performs better than both of the two baseline models, and show that a number of the bank statement-derived features have value in improving the credit scoring model. The target data set used for modelling was highly imbalanced, and Naive Bayes was found to be the best performing model, and outperformed a number of other classifiers commonly used in credit scoring, suggesting its potential for future use on highly imbalanced data sets.

연구 동기 및 목표

  • 대출 신청서에 기재되지 않은 은행 명세서에서 유도된 특징이 신용 평가 모델의 성능을 향상시킬 수 있는지 평가하는 것.
  • 기존 신청서 특징에 기반한 모델과 은행 명세서에서 유도된 특징에 기반한 모델 간의 예측 성능을 비교하는 것.
  • 두 유형의 특징을 통합하여 개선된 신용 리스크 평가를 위한 병합 모델을 개발하고 평가하는 것.
  • 나이브 베이즈가 극도로 불균형한 신용 평가 데이터셋에 적합한지 평가하는 것.

제안 방법

  • 기존의 11개 응용 양식 특징만을 사용하여 기준 모델을 구축하였다.
  • 90일 분기 은행 명세서 데이터에서 유도된 5개의 새로운 특징만을 사용하여 두 번째 기준 모델을 생성하였다.
  • 두 특징 집합을 결합하여 평가를 위한 단일 16개 특징 모델을 구성하였다.
  • 연속적인 은행 명세서 특징을 구간으로 변환하기 위해 Fayyad & Irani의 이산화 방법을 적용하였다.
  • 특징 인코딩을 향상시키고 모델의 해석 가능성을 높이기 위해 Weight of Evidence(WOE) 변환을 사용하였다.
  • ROC AUC를 기준으로 여러 분류기 모델을 평가하였으며, 그 중 나기브 베이즈가 가장 뛰어난 성능을 보였다.

실험 결과

연구 질문

  • RQ1대출 신청서에 기재되지 않은 은행 명세서에서 유도된 특징이 신용 평가 모델의 성능을 향상시킬 수 있는가?
  • RQ2은행 명세서 특징만을 사용한 모델과 응용 양식 특징만을 사용한 모델 간의 예측 능력은 어떻게 비교되는가?
  • RQ3은행 명세서 특징을 기존 응용 양식 특징과 병합하면 모델 성능에 유의미한 향상이 이루어지는가?
  • RQ4나이브 베이즈는 극도로 불균형한 신용 평가 데이터셋에 대해 실용적이고 효과적인 분류기인가?

주요 결과

  • 응용 양식 특징 11개와 은행 명세서에서 유도된 특징 5개를 포함한 병합 특징 모델이 최고의 AUC(0.791)를 기록하여 두 기준 모델을 모두 앞섰다.
  • 응용 양식 특징만을 사용한 기준 모델의 AUC가 은행 명세서 특징만을 사용한 모델보다 높았으며, 이는 후자가 단독으로 강력한 예측을 하기에 부족하다는 것을 시사한다.
  • 나이브 베이즈 분류기는 특히 극도로 불균형한 데이터에서 다른 일반적으로 사용되는 분류기들보다 뛰어난 성능을 보였다.
  • 특정 은행 명세서에서 유도된 5개의 특징—예를 들어 특정 신용카드 유형을 소지하고 있거나 특정 금융기관과 거래하지 않는 것—은 뚜렷한 Weight of Evidence(WOE) 값을 보이며 예측 가능성과 관련성이 있음을 나타냈다.
  • 오분류 비용 비율 x=2(거짓 양성 결과가 거짓 음성 결과보다 두 배 더 비싸게 간주됨)인 모델은 참 양성률이 0.953이며, 좋은 신용 대상자 7,401명 중 7,059명을 정확히 분류하였다.
  • 이 연구는 나기브 베이즈가 이와 같은 맥락에서 강력한 성능을 보였기 때문에, 특히 불균형 데이터셋에서의 신용 평가 분야에서 더 깊이 있는 연구가 필요하다고 제안한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.