[논문 리뷰] Markov model with machine learning integration for fraud detection in health insurance
이 논문은 정확도를 향상시키고 거짓 긍정률을 줄이기 위해 마르코프 모델과 기울기 부스팅을 통합하여 건강 보험에 대한 하이브리드 사기 탐지 모델을 제안한다. 382,587건의 청구 내역(중 38,082건이 사기)을 포함한 데이터셋을 사용하여, 개선된 모델은 97.10%의 정확도와 F1-스코어 0.8546을 달성하였으며, 단독 마르코프 모델(94.07% 정확도, F1-스코어 0.6683)에 비해 유의미하게 뛰어난 성능을 보였다.
Fraud has led to a huge addition of expenses in health insurance sector in India. The work is aimed to provide methods applied to health insurance fraud detection. The work presents two approaches - a markov model and an improved markov model using gradient boosting method in health insurance claims. The dataset 382,587 claims of which 38,082 claims are fraudulent. The markov based model gave the accuracy of 94.07% with F1-score at 0.6683. However, the improved markov model performed much better in comparison with the accuracy of 97.10% and F1-score of 0.8546. It was observed that the improved markov model gave much lower false positives compared to markov model.
연구 동기 및 목표
- 인도에서 증가하는 건강 보험 사기로 인한 재정적 부담을 데이터 기반 탐지 방법을 통해 해결하고자 한다.
- 건강 보험 데이터의 순차적 청구 패턴에 특화된 마르코프 모델을 개발하고자 한다.
- 마르코프 모델에 기울기 부스팅을 통합하여 사기 탐지 성능을 향상시키고자 한다.
- 기존의 단일 마르코프 모델 대비 거짓 긍정률을 낮추고자 한다.
- 실제 보험 청구 데이터에 대한 하이브리드 기계학습 및 확률적 모델링의 효과를 평가하고자 한다.
제안 방법
- 청구 관련 사건 간 상태 전이를 포착하기 위해 마르코프 체인을 사용하여 청구 시퀀스를 모델링한다.
- 마르코프 모델에서 추출한 특징을 바탕으로 예측을 개선하기 위해 기울기 부스팅 프레임워크(XGBoost)를 적용한다.
- 382,587건의 청구 내역(중 38,082건이 사기)을 포함한 데이터셋을 사용하여 모델을 훈련하고 검증한다.
- 마르코프 모델을 청구 전이 확률에 기반해 훈련하고, 그 출력을 기울기 부스팅의 입력 특징으로 사용한다.
- 훈련 세트에서 초모수 튜닝과 교차 검증을 통해 모델 성능을 최적화한다.
- 정확도, F1-스코어, 거짓 긍정률 등의 표준 지표를 사용하여 모델을 평가한다.
실험 결과
연구 질문
- RQ1마르코프 모델은 건강 보험 청구 내역의 순차적 패턴을 사기 탐지에 효과적으로 포착할 수 있는가?
- RQ2마르코프 모델에 기울기 부스팅을 통합할 경우, 단독 마르코프 모델 대비 탐지 정확도와 F1-스코어는 얼마나 향상되는가?
- RQ3하이브리드 모델은 사기 탐지에서 거짓 긍정률을 어느 정도 감소시키는가?
- RQ4고사기 비율이 높은 실세계 인도 건강 보험 청구 데이터셋에서 하이브리드 모델의 성능은 어떠한가?
- RQ5마르코프 상태 전이에서 유도된 특징 표현은 기울기 부스팅 성능을 어떻게 향상시키는가?
주요 결과
- 단독 마르코프 모델은 건강 보험 청구 내역 데이터셋에서 94.07%의 정확도와 F1-스코어 0.6683을 기록하였다.
- 기울기 부스팅을 통합한 개선된 마르코프 모델은 97.10%의 정확도를 달성하여 기준 모델 대비 3.03%p 향상되었다.
- 하이브리드 모델은 F1-스코어 0.8546을 기록하여 마르코프 모델의 0.6683에 비해 유의미하게 향상되었으며, 정밀도와 재현율의 균형이 뛰어나다는 것을 시사한다.
- 개선된 모델은 단독 마르코프 모델 대비 상당히 낮은 거짓 긍정률을 보였으며, 실용적 활용도가 향상되었다.
- 기울기 부스팅과 마르코프 상태 특징의 통합은 특히 복잡한 사기 패턴을 식별하는 데 있어 탐지 성능을 크게 향상시켰다.
- 결과적으로 확률적 모델링과 앙상블 기계학습을 융합할 경우 건강 보험 사기 탐지에서 뛰어난 성과를 낼 수 있음을 확인하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.