Skip to main content
QUICK REVIEW

[논문 리뷰] Calibration of Machine Learning Classifiers for Probability of Default Modelling

Pedro G. Fonseca, Hugo Lopes|arXiv (Cornell University)|2017. 10. 24.
Advanced Data Processing Techniques인용 수 9
한 줄 요약

이 논문은 신용 스코링 분야의 기계학습 분류기에서 확률의 도래 가능성(PD) 추정을 위한 校정 기법—플랫 스킴(Platt Scaling)과 등방성 회귀(Isotonic Regression)—을 평가한다. 18개의 실세계 데이터셋을 시계열로 간주하여 분석한 결과, 등방성 회귀를 이용한 재 校정이 장기적인 校정 성능을 크게 향상시키며, 비모수적 모델인 그래디언트 부스팅이 브리어 스코어 손실에서 로지스틱 회귀보다 뛰어난 성능을 발휘함을 입증한다.

ABSTRACT

Binary classification is highly used in credit scoring in the estimation of probability of default. The validation of such predictive models is based both on rank ability, and also on calibration (i.e. how accurately the probabilities output by the model map to the observed probabilities). In this study we cover the current best practices regarding calibration for binary classification, and explore how different approaches yield different results on real world credit scoring data. The limitations of evaluating credit scoring models using only rank ability metrics are explored. A benchmark is run on 18 real world datasets, and results compared. The calibration techniques used are Platt Scaling and Isotonic Regression. Also, different machine learning models are used: Logistic Regression, Random Forest Classifiers, and Gradient Boosting Classifiers. Results show that when the dataset is treated as a time series, the use of re-calibration with Isotonic Regression is able to improve the long term calibration better than the alternative methods. Using re-calibration, the non-parametric models are able to outperform the Logistic Regression on Brier Score Loss.

연구 동기 및 목표

  • 신용 스코링 모델 검증에서 순위 능력 지표에만 의존하는 데서 비롯하는 한계를 해결하기 위해.
  • 교정 기법이 기계학습 분류기의 PD 모델링에서 확률 추정의 정확도에 어떤 영향을 미치는지 평가하기 위해.
  • 로지스틱 회귀, 랜덤 포레스트, 그래디언트 부스팅 분류기의 성능을 다양한 교정 방법에 따라 비교하기 위해.
  • 데이터셋을 시계열로 간주할 경우 시간이 지남에 따라 재교정이 어떤 영향을 미치는지 평가하기 위해.
  • 적절한 등방성 회귀를 통한 교정을 통해 비모수적 모델이 로지스틱 회귀를 능가할 수 있는지 판단하기 위해.

제안 방법

  • 원시 모델 출력을 조정하기 위해 플랫 스킴과 등방성 회귀를 후처리 교정 기법으로 활용한다.
  • 모델의 실제 운영 환경을 시뮬레이션하기 위해 각 데이터셋을 시계열로 간주하여 정기적인 간격으로 재교정을 수행한다.
  • 장기적 성능를 평가하기 위해 교정 기법을 훈련 세트와 검증 세트에 별도로 적용한다.
  • 교정 품질 평가의 주요 지표로 브리어 스코어 손실을 사용하여 예측 확률과 실제 확률 간의 차이를 측정한다.
  • AUC와 같은 순위 능력(예: AUC)과 교정(브리어 스코어) 지표를 모두 사용하여 18개의 실세계 신용 스코링 데이터셋에서 모델 성능을 비교한다.
  • 비모수적 모델과 로지스틱 회귀 간의 교정 영향을 체계적으로 평가하기 위한 벤치마킹 프레임워크를 구현한다.

실험 결과

연구 질문

  • RQ1교정이 기계학습 분류기의 PD 모델링에서 장기적인 확률 추정 신뢰성에 어떤 영향을 미치는가?
  • RQ2비모수적 모델의 브리어 스코어 손실을 등방성 회귀 재교정을 통해 로지스틱 회귀보다 향상시킬 수 있는가?
  • RQ3순위 능력 지표(예: AUC)가 신용 스코링 모델의 교정 문제를 얼마나 잘 반영하지 못하는가?
  • RQ4데이터셋을 시계열로 간주할 경우, 교정된 모델의 성능이 시간이 지남에 따라 어떻게 변화하는가?
  • RQ5PD 추정을 위한 모델 교정 향상에 있어 플랫 스킴과 등방성 회귀의 비교적 효과성은 어떠한가?

주요 결과

  • 데이터셋을 시계열로 간주할 경우, 등방성 회귀를 통한 재교정이 장기적 교정 성능을 크게 향상시킨다.
  • 등방성 회귀를 통한 재교정 후 비모수적 모델인 그래디언트 부스팅 분류기가 로지스틱 회귀보다 브리어 스코어 손실에서 뛰어난 성능을 보인다.
  • 등방성 회귀와 같은 교정 기법은 특히 동적인 신용 리스크 환경에서 확률 추정의 신뢰성을 향상시키는 데 필수적이다.
  • 순수하게 순위 능력 지표(예: AUC)에 의존할 경우 교정이 부족한 상황이 가려질 수 있으며, 이는 모델 예측에 대한 과도한 자신감을 유도할 수 있다.
  • 특히 비선형적이고 복잡한 데이터 분포에서 등방성 회귀는 플랫 스킴보다 장기적으로 정확한 확률 추정을 유지하는 데 뛰어난 성능을 보인다.
  • 18개의 실세계 데이터셋에 대한 벤치마킹 결과, 비모수적 모델이 유사한 AUC 성능를 유지하면서도 교정 지표에서 로지스틱 회귀를 일관되게 능가함을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.