Skip to main content
QUICK REVIEW

[논문 리뷰] Fraud Dataset Benchmark and Applications

Prince Grover, Julia Xu|arXiv (Cornell University)|2022. 08. 30.
Imbalanced Data Classification Techniques인용 수 5
한 줄 요약

이 논문은 카드가 없는 거래, 봇 공격, 악성 URL, 대출 불이행, 콘텐츠 모니터링을 포함한 다양한 분야의 공개된 사기 탐지 데이터셋을 포함하는 표준화된 사기 데이터셋 벤치마크(Fraud Dataset Benchmark, FDB)를 소개한다. FDB는 일관된 파이썬 API를 제공하여 데이터 로딩을 가능하게 하며, 사전 정의된 훈련/테스트 분할을 통해 클래스 불균형, 고카디널리티 특성, 적대적 패턴 이동과 같은 핵심 과제에 대한 사기 탐지 기법의 체계적 평가를 가능하게 한다. 실험 결과, 삼중 학습과 하이브리드 자기학습 접근 방식이 기준 모델을 능가하는 것으로 나타났다.

ABSTRACT

Standardized datasets and benchmarks have spurred innovations in computer vision, natural language processing, multi-modal and tabular settings. We note that, as compared to other well researched fields, fraud detection has unique challenges: high-class imbalance, diverse feature types, frequently changing fraud patterns, and adversarial nature of the problem. Due to these, the modeling approaches evaluated on datasets from other research fields may not work well for the fraud detection. In this paper, we introduce Fraud Dataset Benchmark (FDB), a compilation of publicly available datasets catered to fraud detection FDB comprises variety of fraud related tasks, ranging from identifying fraudulent card-not-present transactions, detecting bot attacks, classifying malicious URLs, estimating risk of loan default to content moderation. The Python based library for FDB provides a consistent API for data loading with standardized training and testing splits. We demonstrate several applications of FDB that are of broad interest for fraud detection, including feature engineering, comparison of supervised learning algorithms, label noise removal, class-imbalance treatment and semi-supervised learning. We hope that FDB provides a common playground for researchers and practitioners in the fraud detection domain to develop robust and customized machine learning techniques targeting various fraud use cases.

연구 동기 및 목표

  • 사기 탐지 분야에서 극심한 클래스 불균형과 적대적 행동과 같은 고유한 과제를 고려한 표준화되고 공개된 벤치마크의 부족을 해결하기 위해.
  • 기밀 또는 전용 데이터에 의존하지 않고도 연구자와 실무자가 사기 탐지 모델을 평가하고 비교할 수 있는 통합된 재현 가능한 플랫폼을 제공하기 위해.
  • 다양하고 실제 세계의 사기 사용 사례를 제공함으로써 강건하고 일반화 가능한 기계학습 기법의 개발을 지원하기 위해, 일관된 데이터 분할과 특성 이름을 제공한다.
  • 라벨 노이즈 제거, 클래스 불균형 완화, 준지도 학습 학습 등 중요한 사기 탐지 응용 분야의 연구를 촉진하기 위해.

제안 방법

  • Kaggle, UCI, OpenML 등의 소스에서 유래한 9개의 공개된 이진 분류 데이터셋을 포함하는 FDB는 다양한 사기 유형, 즉 거래 사기, 봇 탐지, 신용 리스크 등을 다룬다.
  • Pandas DataFrames로 데이터셋을 로드할 수 있도록 표준화된 API를 갖춘 파이썬 라이브러리가 구현되었으며, 자동으로 훈련/테스트 분할을 생성하고 일관된 특성 이름을 제공한다.
  • 벤치마크는 데이터 샘플링, AutoML 프레임워크용 더미 변수 생성, scikit-learn, XGBoost, CatBoost와 같은 인기 있는 기계학습 라이브러리와의 통합을 지원한다.
  • 4개의 핵심 응용 분야를 평가한다: 전통적인 기계학습 및 AutoML를 활용한 지도 학습, 라벨 노이즈 탐지, 클래스 불균형 대응, 자기학습 및 삼중 학습을 활용한 준지도 학습.
  • 준지도 학습은 자기학습, 삼중 학습, VIME를 사용하여 테스트하며, 자기학습 단계에서의 특성 추출과 전체 프레임워크를 비교하는 분석 실험을 수행한다.
  • 실험은 7개의 데이터셋에서 4개의 레이블링 비율(5%에서 50%)로 수행되었으며, 성능은 AUC로 측정되었고, 각 데이터셋과 레이블링 비율별로 순위가 매겨졌다.

실험 결과

연구 질문

  • RQ1일관된 데이터 분할과 특성 규칙을 갖춘 표준화된 사기 탐지 데이터셋에서 다양한 지도 학습 알고리즘이 어떻게 성능을 내는가?
  • RQ2극심한 클래스 불균형이 있는 실제 사기 데이터셋에서 라벨 노이즈 탐지 기법이 잘못 레이블링된 샘플을 효과적으로 식별할 수 있는가?
  • RQ3다양한 클래스 불균형 완화 전략은 극도로 불균형한 사기 거래 대비 정상 거래 비율에서 모델의 일반화 능력을 얼마나 향상시키는가?
  • RQ4제한된 레이블이 있는 다양한 사기 탐지 작업에서, 자기학습, 삼중 학습, 또는 VIME 중 어떤 준지도 학습 접근 방식이 가장 높은 성능을 낼 수 있는가?
  • RQ5트리 기반 모델인 CatBoost와 결합할 때, 비라벨 데이터에서의 표현 학습이 사기 탐지 성능 향상에 기여하는가?

주요 결과

  • 기본 설정으로 삼중 학습이 가장 높은 성능을 기록했으며, 28개 실험 구성 중 10개(7개 데이터셋 × 4개 레이블링 비율)에서 1위를 차지했다.
  • 보수적인 삼중 학습 변형 버전이 10개의 케이스에서 1위를 기록하여, 노이즈가 있거나 모호한 샘플을 다룰 때 더 높은 강건성을 보였다.
  • 자기학습은 어떤 시나리오에서도 최고 성능을 내지 못했으며, 이는 이 방법의 알려진 한계인 과적합 때문일 가능성이 높다.
  • 기본 VIME 프레임워크는 성능이 열악했으며, 허위일괄 데이터셋에서만 1위를 차지했다. 이는 표본형 사기 데이터에 대해 효과적이지 않음을 시사한다.
  • 자기학습 표현을 CatBoost와 조합했을 때 일부 사례에서 성능 향상이 있었지만, 기준 모델을 크게 뛰어넘지는 못했으며, 이 하이브리드 접근 방식의 이점이 제한적임을 시사한다.
  • 벤치마크는 다양한 사기 탐지 작업 간 일관되고 재현 가능한 평가를 가능하게 하여, 데이터 분포와 분할 변동성과 관련된 혼란 요인을 줄였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.