[논문 리뷰] Prediction of motor insurance claims occurrence as an imbalanced machine learning problem
이 연구는 실제 데이터셋을 대상으로 다수의 기계학습 모델—로지스틱 회귀, 결정 트리, 랜덤 포레스트, XGBoost, 딥 러닝—을 적용하여 자동차 보험 청구 예측에서 데이터 불균형 문제를 다룹니다. SMOTE 오버샘플링과 하이퍼파라미터 튜닝을 적용한 후, XGBoost와 딥 러닝 모델이 가장 높은 AUC(0.6439)와 AUPRC(0.2629)를 기록하여 앙상블 및 신경망 방법이 데이터 불균형 하에서 희귀사건 청구 예측에서 전통적 모델을 능가함을 보여줍니다.
The insurance industry, with its large datasets, is a natural place to use big data solutions. However it must be stressed, that significant number of applications for machine learning in insurance industry, like fraud detection or claim prediction, deals with the problem of machine learning on an imbalanced data set. This is due to the fact that frauds or claims are rare events when compared with the entire population of drivers. The problem of imbalanced learning is often hard to overcome. Therefore, the main goal of this work is to present and apply various methods of dealing with an imbalanced dataset in the context of claim occurrence prediction in car insurance. In addition, the above techniques are used to compare the results of machine learning algorithms in the context of claim occurrence prediction in car insurance. Our study covers the following techniques: logistic-regression, decision tree, random forest, xgBoost, feed-forward network. The problem is the classification one.
연구 동기 및 목표
- 희귀사건인 청구가 드문 자동차 보험 청구 예측에서의 데이터 불균형 문제를 해결하기 위해.
- 이 불균형 분류 작업에서 로지스틱 회귀, 결정 트리, 랜덤 포레스트, XGBoost, 딥 러닝 등 다양한 기계학습 모델의 성능을 평가하고 비교하기 위해.
- 데이터 수준(SMOTE) 및 알고리즘 수준(클래스 가중치) 기법이 희귀 청구 사건 예측 성능 향상에 미치는 영향을 평가하기 위해.
- 실제 비생명 보험 데이터셋에서 청구 발생을 예측하기 위한 가장 강력하고 정확한 모델을 특정하기 위해.
제안 방법
- 데이터셋의 소수 클래스(청구)를 균형 있게 만들기 위해 SMOTE 오버샘플링을 적용했습니다.
- 모든 모델에 대해 Sklearn GridSearchCV와 Keras Tuner Hyperband를 활용하여 하이퍼파라미터 튜닝을 수행했습니다.
- 클래스 불균형을 반영하기 위해 XGBoost와 딥 러닝 모델에 클래스 가중치를 적용했습니다.
- 로지스틱 회귀, 결정 트리, 랜덤 포레스트, XGBoost, 피드포워드 신경망 등 여러 모델을 훈련하고 평가했습니다.
- 정확도, F1-score, 정밀도, 재현율, AUC, AUPRC와 같은 표준 지표를 사용해 모델을 평가했습니다.
- 모델 해석을 위해 트리 기반 모델(XGBoost, 랜덤 포레스트)을 활용한 특성 중요도 시각화와 혼동 행렬을 제시했습니다.
실험 결과
연구 질문
- RQ1불균형 데이터셋에서 희귀 보험 청구 사건을 예측하는 데 가장 우수한 성능을 보이는 기계학습 모델은 무엇인가요?
- RQ2데이터 수준(SMOTE) 및 알고리즘 수준(클래스 가중치) 기법은 청구 예측 성능에 어떻게 영향을 미치나요?
- RQ3이러한 불균형 환경에서 하이퍼파라미터 튜닝은 다양한 알고리즘의 성능에 어떤 영향을 미치나요?
- RQ4XGBoost와 랜덤 포레스트와 같은 트리 기반 모델 간의 특성 중요도 순위는 청구 예측 맥락에서 어떻게 다릅니까?
주요 결과
- 하이퍼파라미터 튜닝과 클래스 가중치 적용 후 XGBoost는 F1-score(0.3549)와 AUC(0.6227)가 가장 높아 다른 모델을 능가했습니다.
- SMOTE 및 클래스 가중치 적용 후 딥 러닝 모델은 AUPRC(0.2629)와 AUC(0.6439)가 가장 높아 희귀사건 탐지에서 뛰어난 성능을 보였습니다.
- 랜덤 포레스트는 AUC 0.6204와 AUPRC 0.2784를 기록하여 딥 러닝에 이어 AUPRC에서 두 번째로 높은 성능을 보였습니다.
- 로지스틱 회귀는 F1-score 0.2421과 AUC 0.5407로 성능이 열악하여 심한 클래스 불균형 처리에서의 한계를 드러냈습니다.
- SMOTE와 클래스 가중치의 사용은 트리 기반 모델의 재현율과 F1을 크게 향상시켰으며, 특히 소수 클래스 청구 탐지에 효과적이었습니다.
- 특성 중요도 분석을 통해 운전 이력과 차량 특성이 상위 예측 변수로 확인되었으며, 이는 보험 actuarial 직관과 일치했습니다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.