Skip to main content
QUICK REVIEW

[논문 리뷰] Credit card fraud detection using machine learning: A survey

Yvan Lucas, Johannes Jurgovsky|arXiv (Cornell University)|2020. 10. 13.
Imbalanced Data Classification Techniques참고 문헌 72인용 수 11
한 줄 요약

이 종합 검토는 신용카드 사기 탐지에 대한 기계학습 기반 접근법에 대한 포괄적인 개요를 제공하며, 클래스 불균형, 개념 드프트, 순차적 거래 패턴과 같은 과제에 초점을 맞춘다. 샘플링, 비용 감수성 학습, LSTM 기반 순차 모델링, 수량 기반 이상 탐지와 같은 기법을 평가하여, 실제 환경에서 특징 공학 및 순차 인식 모델이 표준 방법보다 뛰어난 성능을 발휘함을 결론내린다.

ABSTRACT

Credit card fraud has emerged as major problem in the electronic payment sector. In this survey, we study data-driven credit card fraud detection particularities and several machine learning methods to address each of its intricate challenges with the goal to identify fraudulent transactions that have been issued illegitimately on behalf of the rightful card owner. In particular, we first characterize a typical credit card detection task: the dataset and its attributes, the metric choice along with some methods to handle such unbalanced datasets. These questions are the entry point of every credit card fraud detection problem. Then we focus on dataset shift (sometimes called concept drift), which refers to the fact that the underlying distribution generating the dataset evolves over times: For example, card holders may change their buying habits over seasons and fraudsters may adapt their strategies. This phenomenon may hinder the usage of machine learning methods for real world datasets such as credit card transactions datasets. Afterwards we highlights different approaches used in order to capture the sequential properties of credit card transactions. These approaches range from feature engineering techniques (transactions aggregations for example) to proper sequence modeling methods such as recurrent neural networks (LSTM) or graphical models (hidden markov models).

연구 동기 및 목표

  • 기계학습 기반 신용카드 사기 탐지 방법에 대한 체계적인 개요를 제공하기 위해.
  • 극심한 클래스 불균형, 데이터셋 이동(개념 드프트), 거래 데이터의 순차 정보 부족과 같은 핵심 과제를 다루기 위해.
  • 실제 사기 탐지 시스템에 적합한 기법을 선택하는 데 연구자와 실무자들을 안내하기 위해.
  • 산업 응용 분야에서의 해석 가능성과 성능 평가의 중요성을 부각하기 위해.

제안 방법

  • 데이터 기반 사기 탐지 접근법을 분석하기 위해 문헌에 대한 체계적 검토를 수행한다.
  • 혼동 행렬 기반 및 비모수적 지표를 사용하여 성능을 평가하며, 불균형 데이터에 대해 F1 점수와 AUC를 강조한다.
  • 클래스 불균형을 다루기 위해 샘플링 기법(예: SMOTE)과 모델 기반 방법(예: 비용 감수성 학습)을 적용한다.
  • 시간적 패턴을 포착하기 위해 LSTM 및 기타 순차 모델을 활용한다.
  • 슬라이딩 윈도우와 가능도 임계값(예: t-STIDE)을 통한 수량 기반 이상 탐지 기법을 사용하여 이상치를 점수화한다.
  • 이상치 점수화를 위해 LSTM 기반 모델에 맞춤형 거리 측도를 도입하여 순차 데이터에서 분류 가능한 학습을 가능하게 한다.

실험 결과

연구 질문

  • RQ1클래스 불균형과 왜곡된 거래 분포는 표준 기계학습 모델의 사기 탐지 성능에 어떤 영향을 미치는가?
  • RQ2LSTM과 같은 순차 모델링 기법은 정적 거래 특징을 넘어서 사기 탐지 성능을 얼마나 향상시킬 수 있는가?
  • RQ3실시간 사기 탐지 시스템에서 데이터셋 이동(개념 드프트)는 어떻게 탐지하고 완화할 수 있는가?
  • RQ4특징 공학은 신용카드 사기 탐지에서 모델 성능 향상과 해석 가능성 향상에 어떤 역할을 하는가?
  • RQ5수량 기반 및 유사도 기반 접근법은 이상 거래 부분 시퀀스 탐지에서 어떻게 비교되는가?

주요 결과

  • LSTM이 순차 패턴을 포착함에도 불구하고, 카드 현장 거래 상황에서는 특징 집계 기법이 순차 모델링보다 뛰어난 성능을 보인다.
  • LSTM 기반 모델은 거래 시퀀스의 잠재 표현을 학습하고 기대 행동에서의 이탈을 측정함으로써 효과적인 이상치 점수화를 달성한다.
  • t-STIDE와 같은 수량 기반 방법은 가능도 임계값 이하의 윈도우 비율을 측정함으로써 해석 가능한 이상치 점수를 제공한다.
  • 개념 드프트는 시간이 지남에 따라 모델 성능을 심각하게 떨어뜨리며, 지속적인 정확도를 확보하기 위해 온라인 학습 또는 주기적 재학습이 필요하다.
  • 샘플링 및 비용 감수성 학습 기법은 특히 적절한 평가 지표와 결합될 경우 클래스 불균형의 영향을 효과적으로 완화한다.
  • 해석 가능성은 여전히 핵심 과제이며, 비전문가 이해관계자들이 모델 결정 과정을 명확히 이해할 수 있도록 하는 데는 진전이 부족하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.