Skip to main content
QUICK REVIEW

[논문 리뷰] Synthetic Data Generation for Fraud Detection using GANs

Charitos Charitou, Simo Dragičević|arXiv (Cornell University)|2021. 09. 26.
Imbalanced Data Classification Techniques참고 문헌 35인용 수 15
한 줄 요약

이 논문은 온라인 도박 내 부정 탐지에서의 클래스 불균형 문제를 해결하기 위해 생성적 적대적 네트워크 기반 프레임워크인 SDG-GAN을 제안한다. 소수 클래스의 고품질 합성 인스턴스를 생성함으로써, SDG-GAN은 분류기 성능을 크게 향상시켰으며, 규칙 기반 시스템 대비 F1 스코어 5% 향상과 함께 SMOTE, ADASYN, B-SMOTE 및 cGAN을 능가했다. 이는 벤치마크 및 실제 도박 부정 탐지 데이터셋에서 입증되었다.

ABSTRACT

Detecting money laundering in gambling is becoming increasingly challenging for the gambling industry as consumers migrate to online channels. Whilst increasingly stringent regulations have been applied over the years to prevent money laundering in gambling, despite this, online gambling is still a channel for criminals to spend proceeds from crime. Complementing online gambling's growth more concerns are raised to its effects compared with gambling in traditional, physical formats, as it might introduce higher levels of problem gambling or fraudulent behaviour due to its nature of immediate interaction with online gambling experience. However, in most cases the main issue when organisations try to tackle those areas is the absence of high quality data. Since fraud detection related issues face the significant problem of the class imbalance, in this paper we propose a novel system based on Generative Adversarial Networks (GANs) for generating synthetic data in order to train a supervised classifier. Our framework Synthetic Data Generation GAN (SDG-GAN), manages to outperformed density based over-sampling methods and improve the classification performance of benchmarks datasets and the real world gambling fraud dataset.

연구 동기 및 목표

  • 온라인 도박 부정 탐지에서 부정 사례가 정상 사례에 비해 극도로 적은 클래스 불균형 문제를 해결하기 위해.
  • 불균형한 구조적 데이터셋에서의 지도 학습 성능을 향상시키기 위한 견고한 합성 데이터 생성 방법을 개발하기 위해.
  • 기존의 및 적대적 샘플링 기법과 비교하여 GAN 기반 오버샘플링의 실세계 부정 탐지 환경에서의 효과성을 평가하기 위해.
  • 개선된 데이터 증강을 통해 온라인 도박 플랫폼에서 고위험 빈도 높은 money laundering 사례의 식별률을 높이기 위해.
  • 공개 벤치마크 데이터셋과 실제 익명의 도박 부정 탐지 데이터셋을 대상으로 제안된 방법을 검증하기 위해.

제안 방법

  • SDG-GAN은 소수 클래스(부정)의 합성 인스턴스를 생성하기 위해 조건부 GAN 아키텍처를 활용하며, 원본 데이터 분포를 유지한다.
  • 생성자 네트워크는 진짜 데이터와 가짜 데이터를 구분하도록 훈련된 판별자와의 적대적 손실을 최소화함으로써 현실적인 합성 샘플을 생성하도록 학습한다.
  • 이 프레임워크는 지도 학습 파이프라인에 통합되어, 분류기 훈련 이전에 소수 클래스를 오버샘플링하기 위해 합성 샘플을 사용한다.
  • 네 가지 분류기인 로지스틱 회귀(LR), 랜덤 포레스트(RF), 다층 퍼셉트론(MLP), XGBoost(XGB)를 사용하여 평가한다.
  • 성능 평가 지표로는 F1 스코어, 정밀도, 재현율을 사용하며, SMOTE, ADASYN, B-SMOTE 및 cGAN과의 비교를 위해 통계적 순위를 적용한다.
  • 모델은 공개 데이터셋(Credit Card Fraud, Breast Cancer Wisconsin, Pima Diabetes)과 총 4,700건의 인스턴스 중 1,200건이 고위험 사례인 실제 도박 부정 탐지 데이터셋에서 훈련된다.

실험 결과

연구 질문

  • RQ1GAN 기반의 합성 데이터 생성 방법은 불균형한 부정 탐지 데이터셋에서 지도 학습 분류기의 성능 향상에 효과적으로 기여할 수 있는가?
  • RQ2SDG-GAN은 F1 스코어와 분류 신뢰성 측면에서 SMOTE, ADASYN, B-SMOTE와 같은 기존 오버샘플링 기법과 비교해 어떻게 성과를 내는가?
  • RQ3SDG-GAN의 적용이 실제 온라인 도박 데이터에서 고위험 빈도 높은 money laundering 사례 식별에 측정 가능한 향상을 이끌어내는가?
  • RQ4SDG-GAN은 전통적 방법이나 다른 GAN 기반 방법보다 구조적 부정 데이터의 복잡한 비선형 패턴을 더 효과적으로 포착하는 고품질의 합성 데이터를 생성할 수 있는가?
  • RQ5SDG-GAN의 성능 향상은 다양한 기계 학습 모델과 다양한 데이터 분포 간에서 일관되게 유지되는가?

주요 결과

  • SDG-GAN은 모든 분류기와 데이터셋에서 평균 순위 2.6으로 가장 높은 총합 순위를 기록했으며, SMOTE, ADASYN, B-SMOTE 및 cGAN을 모두 능가했다.
  • 실제 도박 부정 탐지 데이터셋에서 XGBoost와 조합했을 때 SDG-GAN은 F1 스코어를 89.73%까지 향상시켰으며, 기존 규칙 기반 시스템 대비 5% 향상되었다.
  • 기존 기반 기술 대비 거짓 양성 및 거짓 음성 수를 감소시켜, 정상 고객과 고위험 고객을 구분하는 모델의 능력을 향상시켰다.
  • 랜덤 포레스트와 함께 사용했을 때, SDG-GAN은 세 가지 벤치마크 데이터셋 중 두 개에서 다른 방법들을 능가했으며, 해당 경우에서 최고의 F1 스코어를 기록했다.
  • 도박 부정 탐지 데이터셋에서 SMOTE 대비 F1 스코어 향상은 약 0.4%였으며, 이는 점진적이지만 일관된 성과 향상을 보여주었다.
  • 결과는 SDG-GAN이 복잡한 데이터 분포를 효과적으로 추정하고 불균형한 부정 탐지 작업에서 소수 클래스 탐지 능력을 향상시킬 수 있다는 가설을 지지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.