Skip to main content
QUICK REVIEW

[논문 리뷰] A Machine Learning-based Anomaly Detection Framework in Life Insurance Contracts

Andreas Groll, Akshat Khanna|arXiv (Cornell University)|2024. 11. 26.
Insurance and Financial Risk ManagementEconomics, Econometrics and Finance인용 수 3
한 줄 요약

이 논문은 레이블이 없는 이상치를 가진 생애 보험 계약 데이터에서 비지도 학습 기반의 이상 탐지 프레임워크를 제안한다. 두 개의 공개 데이터셋에서 기존 기법들인 Isolation Forest와 오토인코더를 평가하여, 특히 변분 오토인코더(Variational Autoencoders)를 포함한 딥러닝 모델이 높은 정확도와 자동화 잠재력을 바탕으로 계약 수준의 이상을 탐지하는 데 뛰어난 성능을 보임을 입증한다.

ABSTRACT

Life insurance, like other forms of insurance, relies heavily on large volumes of data. The business model is based on an exchange where companies receive payments in return for the promise to provide coverage in case of an accident. Thus, trust in the integrity of the data stored in databases is crucial. One method to ensure data reliability is the automatic detection of anomalies. While this approach is highly useful, it is also challenging due to the scarcity of labeled data that distinguish between normal and anomalous contracts or inter\-actions. This manuscript discusses several classical and modern unsupervised anomaly detection methods and compares their performance across two different datasets. In order to facilitate the adoption of these methods by companies, this work also explores ways to automate the process, making it accessible even to non-data scientists.

연구 동기 및 목표

  • 레이블이 있는 이상치가 부족하거나 존재하지 않는 생애 보험 데이터에서 이상 탐지를 해결하고자 한다.
  • 클래식한 비지도 학습 기법(예: k-means, DBSCAN, Isolation Forest, OCSVM)과 최신 딥러닝 모델(오토인코더, VAE)이 계약 수준의 이상을 탐지하는 데 얼마나 효과적인지 비교하고자 한다.
  • 실제 보험 운영에 활용 가능한 비전문가 친화적인 자동화된 이상 탐지 파이프라인을 개발하고자 한다.
  • 실제 데이터 비정상성을 시뮬레이션하기 위해 수작업으로 삽입된 이상을 사용하여 모델 성능을 평가하고자 한다.
  • 데이터 과학 전문 지식이 거의 필요 없는 실용적이고 확장 가능한 프레임워크를 제공하여 보험사가 데이터 무결성과 사기 탐지 능력을 향상시킬 수 있도록 하고자 한다.

제안 방법

  • 생애 보험 데이터셋에서 이상치를 식별하기 위해 거리 기반 방법(예: k-means, DBSCAN, HDBSCAN), 트리 기반의 Isolation Forest, 그리고 일변도 SVM(OCSVM)과 같은 비지도 이상 탐지 기법을 활용한다.
  • 딥러닝 모델인 오토인코더(AEs)와 변분 오토인코더(VAEs)를 적용하여 저차원 표현을 학습하고 복원 오차를 통해 이상치를 탐지한다.
  • Isolation Forest의 경우 그리드 서치를 통해 자동으로 초모수 튜닝을 수행하며(파라미터: f_max, s_max, n_estimators), 다른 모델들은 수동 또는 실험적 튜닝이 필요하다.
  • 모든 모델과의 호환성을 확보하기 위해 범주형 변수는 원핫 인코딩, 수치형 특성은 표준화하여 데이터 전처리를 수행한다.
  • 다양한 지표를 조합하여 모델 성능을 평가한다: 수작업으로 삽입된 4개의 이상 사례 중 탐지된 이상 수, 오토인코더/VAE의 경우 복원 오차, Isolation Forest의 경우 이상도, 클러스터링 방법의 경우 실루엣 스코어.
  • 임계치 기반 분류를 적용한다: 복원 오차가 고정된 임계치(오토인코더의 경우 0.5, VAE의 경우 0.7)를 초과하는 인스턴스 또는 이상도가 학습된 컷오프를 초과하는 인스턴스를 이상으로 간주한다.
Figure 1 : An example representation of anomalous and normal points in an example data set with two variables, $X$ and $Y$ , taken from Chandola et al. ( 2009 ) .
Figure 1 : An example representation of anomalous and normal points in an example data set with two variables, $X$ and $Y$ , taken from Chandola et al. ( 2009 ) .

실험 결과

연구 질문

  • RQ1레이블이 제한된 생애 보험 데이터에서 기존 비지도 이상 탐지 기법(예: Isolation Forest, OCSVM, k-means)이 계약 수준의 이상을 탐지하는 데 얼마나 효과적인가?
  • RQ2딥러닝 기반 오토인코더 모델(AEs 및 VAEs)이 기존 머신러닝 기법보다 생애 보험 데이터셋에서 이상을 탐지하는 데 얼마나 뛰어나게 성능을 발휘하는가?
  • RQ3자동 초모수 튜닝이 비전문가 환경에서 이상 탐지 모델의 강건성과 재현 가능성을 향상시킬 수 있는가?
  • RQ4특히 더 큰 또는 더 복잡한 데이터 구조를 처리할 때, 다양한 데이터셋 간에 모델의 실행 시간과 확장성은 어떻게 달라지는가?
  • RQ5아키텍처 설계(예: 깊이, 잠재 차원 수)는 오토인코더와 변분 오토인코더의 이상 탐지 작업에서 성능과 효율성에 어떤 영향을 미치는가?

주요 결과

  • 변분 오토인코더(VAEs)는 두 데이터셋 모두에서 수작업으로 삽입된 4개의 이상을 모두 탐지하여 가장 높은 탐지율을 기록했으며, 각각 Dataset 1에서는 548건, Dataset 2에서는 512건의 총 이상을 탐지했다.
  • Isolation Forest는 두 데이터셋 모두에서 기존 기법들을 초월하여 성능을 발휘했으며, Dataset 1에서는 4개의 이상을 모두 탐지하고, Dataset 2에서도 4개의 이상을 모두 탐지했으며, 총 탐지 이상 수는 각각 342건과 1974건이었다.
  • 오토인코더는 Dataset 1에서는 224건, Dataset 2에서는 705건의 이상을 탐지했으며, 4개의 이상 중 4개를 정확히 식별했고, Dataset 1에서는 학습 시간이 3분 미만이었다.
  • Dataset 2에서 가장 우수한 성능을 보인 VAE 모델은 학습률 1e-2, 950 에포크, 10차원의 잠재 공간을 사용하여 가장 높은 이상 탐지 재현율을 달성했다.
  • DBSCAN과 HDBSCAN과 같은 기존 기법들은 Dataset 2에서 높은 계산 부하로 인해 완료되지 못했으며, 실행 시간이 5시간을 초과했고, 반면 Isolation Forest와 OCSVM은 10초 이내에 완료되었다.
  • Dataset 2에서 VAE의 복원 오차 임계치 0.7은 수작업 검토를 통해 진짜 이상 탐지 수를 극대화하면서도 가짜 이상 수를 최소화하는 데 최적임이 확인되었다.
Figure 2 : Proportion of anomalies and detected manual anomalies (secondary $y$ -axis).
Figure 2 : Proportion of anomalies and detected manual anomalies (secondary $y$ -axis).

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.