[논문 리뷰] Sequence embeddings help to identify fraudulent cases in healthcare insurance
이 논문은 의료 보험 청구 데이터에 특화된 딥러닝 기반 시퀀스 임베딩을 제안하여 사기 탐지 성능을 향상시킨다. 치료 코드와 ICD 진단을 가변 길이의 시퀀스로 모델링함으로써, 최신 기술 수준의 모델을 능가하며 SMOTEENN 리샘플링을 사용할 경우 AUC 0.8515를 달성하고 데이터 왜곡에 대한 강건성도 입증한다.
Fraud causes substantial costs and losses for companies and clients in the finance and insurance industries. Examples are fraudulent credit card transactions or fraudulent claims. It has been estimated that roughly $10$ percent of the insurance industry's incurred losses and loss adjustment expenses each year stem from fraudulent claims. The rise and proliferation of digitization in finance and insurance have lead to big data sets, consisting in particular of text data, which can be used for fraud detection. In this paper, we propose architectures for text embeddings via deep learning, which help to improve the detection of fraudulent claims compared to other machine learning methods. We illustrate our methods using a data set from a large international health insurance company. The empirical results show that our approach outperforms other state-of-the-art methods and can help make the claims management process more efficient. As (unstructured) text data become increasingly available to economists and econometricians, our proposed methods will be valuable for many similar applications, particularly when variables have a large number of categories as is typical for example of the International Classification of Disease (ICD) codes in health economics and health services.
연구 동기 및 목표
- 전자 건강 기록에서 유래한 비정형적이고 고카디널리티(고다양성)의 청구 데이터에서 사기성 보험 청구를 탐지하는 과제를 해결한다.
- 특히 ICD-10과 같은 많은 범주형 코드를 포함한 불균형하고 가변 길이의 청구 데이터에서 전통적인 머신러닝의 한계를 극복한다.
- 의료 치료 및 진단의 시퀀스로부터 의미 있는 저차원 임베딩을 학습하는 딥러닝 아키텍처를 개발한다.
- 실제 보험 데이터를 활용하여 정확하고 확장 가능한 사기 탐지 기능을 제공함으로써 청구 관리 효율성을 향상시킨다.
- 금융 및 보험 시스템에서 흔히 발생하는 데이터 왜곡과 악성 공격에 대한 모델 신뢰성을 확보한다.
제안 방법
- 의료 코드(예: ICD-10, 절차 코드)의 가변 길이 시퀀스를 조밀한 벡터 표현으로 매핑하기 위해 시퀀스 모델링 기법을 사용한다.
- 어텐션 메커니즘(예: SWEM-max)을 갖춘 딥 네트워크를 적용하여 치료 시퀀스를 고정 길이의 임베딩으로 요약한다.
- 학습된 임베딩을 기반으로 기울기 부스팅 모델과 통합하여 종단 간 사기 분류를 수행한다.
- 입력 왜곡과 악성 공격에 대한 강건성을 향상시키기 위해 데이터 증강 및 적대적 훈련을 적용한다.
- 사기 사례가 희귀한 불균형 데이터를 처리하기 위해 리샘플링 기법(SMOTEENN, ADASYN)을 적용한다.
- 성능 평가를 위한 기준선으로 TF-IDF 특징을 사용하며, 기울기 부스팅과 조합하여 제안된 임베딩 기반 접근법과의 성능를 비교한다.
실험 결과
연구 질문
- RQ1딥러닝 기반 시퀀스 임베딩가 전통적인 머신러닝 방법에 비해 의료 보험 청구의 사기 탐지 성능을 향상시킬 수 있는가?
- RQ2다양한 리샘플링 기법(예: SMOTEENN, ADASYN)이 극도로 불균형한 청구 데이터에서 모델 성능에 어떤 영향을 미치는가?
- RQ3제안된 모델이 치료 시퀀스의 무작위 및 적대적 왜곡에 대해 어느 정도 강건한가?
- RQ4학습된 임베딩가 청구 데이터의 사기 관련 패턴을 포착하는 데 있어 표준 TF-IDF 표현에 비해 어떻게 비교되는가?
- RQ5ICD 코드와 같은 고카디널리티의 범주형 변수를 포함한 실제 청구 데이터에 대해 모델이 일반화 가능한가?
주요 결과
- 제안된 시퀀스 임베딩 모델은 InstanceHardnessThreshold 리샘플링 기법을 사용하여 AUC 0.8515를 달성하였으며, 다른 최신 기술 수준의 방법들을 능가하였다.
- SWEM-max 모델은 적대적 공격 하에서 성능 저하가 심각하게 발생하여 악성 입력 왜곡에 취약함을 보였다.
- 무작위 왜곡(예: 시퀀스 끝에 치료를 추가하는 것)은 모델 성능에 미미한 영향을 미쳐 노이즈에 대해 중간 수준의 강건성을 보였다.
- 기울기 부스팅과 조합된 TF-IDF 기반 모델은 SWEM 기반 모델보다 무작위 손상 상황에서 더 높은 안정성을 보였다.
- 이 연구는 의료 코드 시퀀스에 대한 딥러닝 임베딩이 실제 보험 데이터에서 전통적 방법에 비해 사기 탐지 정확도를 크게 향상시킴을 확인한다.
- 특히 왜곡된 청구 예제를 포함한 증강 데이터의 증가와 아키텍처 최적화를 통해 모델 성능을 추가로 향상시킬 수 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.