[논문 리뷰] Prediction of Customer Churn in Banking Industry
이 연구는 10,000명의 유럽 은행 고객의 인구통계학적 및 개인 정보 데이터를 사용하여 은행 부문의 고객 이탈을 예측하기 위해 여섯 가지 지도 학습 모델을 평가한다. 단일 은닉층에 다섯 개의 뉴런을 가진 인공 신경망(ANN)이 다른 모델들보다 뛰어나며, 클래스 불균형과 이방값에 대한 강건성과 명백한 과적합이 없음을 보이며, 이는 이 맥락에서 이탈 예측에 최적의 선택임을 시사한다.
With the growing competition in banking industry, banks are required to follow customer retention strategies while they are trying to increase their market share by acquiring new customers. This study compares the performance of six supervised classification techniques to suggest an efficient model to predict customer churn in banking industry, given 10 demographic and personal attributes from 10000 customers of European banks. The effect of feature selection, class imbalance, and outliers will be discussed for ANN and random forest as the two competing models. As shown, unlike random forest, ANN does not reveal any serious concern regarding overfitting and is also robust to noise. Therefore, ANN structure with five nodes in a single hidden layer is recognized as the best performing classifier.
연구 동기 및 목표
- 은행 산업에서 고객 이탈을 예측하기 위한 가장 효과적인 기계학습 모델을 특정하는 것.
- 특성 선택, 클래스 불균형, 이방값이 모델 성능에 미치는 영향을 평가하는 것.
- 인공 신경망(ANN)과 랜덤 포레스트의 강건성과 일반화 능력을 비교하는 것.
- 실제 은행 데이터셋에서 ANN과 랜덤 포레스트가 데이터 노이즈와 클래스 불균형을 어떻게 다루는지 평가하는 것.
- 은행이 효과적인 고객 유지를 위한 전략을 구현하고자 할 때 데이터 기반의 권고를 제공하는 것.
제안 방법
- 10,000명의 유럽 은행 고객과 10개의 인구통계학적 및 개인 정보 특성으로 구성된 데이터셋에 대해 여섯 가지 지도 분류 기법을 적용하였다.
- 차원을 줄이고 모델 효율성을 향상시키기 위해 특성 선택 기법을 적용하였다.
- 특히 불균형 데이터에 민감한 모델을 위해, 재표본 추출 또는 클래스 가중치 기법을 사용하여 클래스 불균형 문제를 다루었다.
- 모델 일반화에 미치는 영향을 평가하기 위해 이방값 탐지 및 처리를 수행하였다.
- 성능 최적화를 위해 단일 은닉층에 다섯 개의 뉴런을 포함한 인공 신경망(ANN) 모델을 훈련시켰다.
- 비교를 위한 기준 모델로 앙상블 학습을 활용하여 과적합을 줄이는 랜덤 포레스트를 사용하였다.
실험 결과
연구 질문
- RQ1은행 산업에서 고객 이탈을 예측하는 데 가장 잘 작동하는 지도 학습 모델은 무엇인가?
- RQ2클래스 불균형은 ANN과 랜덤 포레스트의 이탈 예측 성능에 어떤 영향을 미치는가?
- RQ3이방값은 ANN과 랜덤 포레스트 모델의 일반화에 어느 정도의 영향을 미치는가?
- RQ4특성 선택은 이탈 예측 모델의 예측 정확도를 향상시키는가?
- RQ5이 맥락에서 ANN은 랜덤 포레스트보다 데이터 노이즈와 클래스 불균형에 더 강건한가?
주요 결과
- 단일 은닉층에 다섯 개의 뉴런을 가진 인공 신경망(ANN)이 테스트된 모든 모델 중에서 가장 높은 예측 성능를 기록하였다.
- 랜덤 포레스트와는 달리 ANN은 명백한 과적합을 보이지 않아 검증 세트에서 강력한 일반화 능력을 보였다.
- ANN은 데이터 노이즈와 이방값에 강건하여, 다양한 전처리 조건에서도 안정된 성능을 유지하였다.
- 클래스 불균형은 모델 성능에 측정 가능한 영향을 미쳤지만, 관리 가능했으며, ANN이 랜덤 포레스트보다 이를 더 효과적으로 처리하였다.
- 특성 선택은 모델 효율성을 향상시키고, 특히 복잡한 모델에서 과적합을 줄이는 데 기여하였다.
- 이 연구는 ANN이 높은 정확도와 내성에 기반하여 은행 부문의 고객 이탈 예측에 가장 적합한 모델임을 결론내린다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.