[논문 리뷰] One-Class Adversarial Nets for Fraud Detection
이 논문은 단지 양성 사용자 데이터만을 사용하여 악성 사용자를 탐지하는 새로운 프raud 탐지 프레임워크인 One-Class Adversarial Nets(OCAN)을 제안한다. OCAN은 순차적인 온라인 활동에서 사용자 표현을 학습하기 위해 LSTM-오토에인코더를 활용하고, 이어지는 보완적 GAN에서는 생성기가 양성 행동의 저밀도 영역에서 악성 사용자와 유사한 가짜 샘플을 생성하며, 구분기는 실제 양성 사용자와 이러한 보완적 샘플을 구분하도록 학습한다. 이로 인해 일종의 프raud 탐지 벤치마크에서 최고 성능을 달성한다.
Many online applications, such as online social networks or knowledge bases, are often attacked by malicious users who commit different types of actions such as vandalism on Wikipedia or fraudulent reviews on eBay. Currently, most of the fraud detection approaches require a training dataset that contains records of both benign and malicious users. However, in practice, there are often no or very few records of malicious users. In this paper, we develop one-class adversarial nets (OCAN) for fraud detection using training data with only benign users. OCAN first uses LSTM-Autoencoder to learn the representations of benign users from their sequences of online activities. It then detects malicious users by training a discriminator with a complementary GAN model that is different from the regular GAN model. Experimental results show that our OCAN outperforms the state-of-the-art one-class classification models and achieves comparable performance with the latest multi-source LSTM model that requires both benign and malicious users in the training phase.
연구 동기 및 목표
- 학습 중에 유일하게 양성 사용자 데이터만 이용 가능한 상황에서 프raud 탐지의 과제를 해결하기 위해.
- 라벨이 부여된 악성 예제가 필요 없이도 악성 사용자 행동을 시뮬레이션할 수 있는 생성 모델을 개발하기 위해.
- 표준 GAN 학습 대신 보완적 샘플 생성을 활용하여 일종의 설정에서 탐지 정확도를 향상시키기 위해.
- 사용자 활동 시퀀스를 모델링하여 동적이고 순차적인 프raud 탐지 기능을 제공하기 위해.
제안 방법
- 양성 사용자에 대한 순차적 시퀀스를 압축된 저차원 표현으로 압축하기 위해 LSTM-오토에인코더를 활용한다.
- 생성기가 양성 사용자 표현과 보완적인 샘플(즉, 저밀도 영역)을 생성하는 보완적 GAN 프레임워크를 도입한다.
- 구분기는 실제 양성 사용자와 생성된 보완적 샘플을 분류하도록 학습하여, 이로 인해 이상치(잠재적 악성 사용자)를 탐지할 수 있도록 한다.
- 학습된 구분기를 최종 분류기로 사용하여, 새로운 사용자의 활동 시퀀스를 바탕으로 그들이 양성인지 악성인지 예측한다.
- 순차적 데이터(예: 편집 이력) 및 수치적 거래 데이터에 모델을 적용하고, 오토에인코더의 구조를 이에 맞게 조정한다.
- 클러스터링과 중심점 거리 분석을 활용하여 표현 공간에서 악성 사용자와 양성 사용자가 분리됨을 검증한다.
실험 결과
연구 질문
- RQ1라벨이 부여된 악성 예제가 없이도, 생성 모델이 양성 사용자 데이터만으로 악성 사용자 행동을 효과적으로 시뮬레이션할 수 있는가?
- RQ2일종의 설정에서 잠재 공간에서의 보완적 샘플 생성이 표준 GAN에 비해 프raud 탐지 성능을 어떻게 향상시키는가?
- RQ3학습 중에 라벨이 부여된 악성 예제가 필요 없이도, M-LSTM와 같은 감독 모델과 유사한 성능을 OCAN이 달성할 수 있는가?
- RQ4다양한 유형의 프raud(예: 훼손 및 신용카드 프raud)에 대해 OCAN은 다양한 데이터 유형에서 일반화 성능을 잘 유지하는가?
- RQ5실제 프raud 탐지에서 흔한 불균형 데이터셋에서도 OCAN은 높은 성능을 유지하는가?
주요 결과
- OCAN은 위키백과의 훼손 탐지 및 신용카드 프raud 탐지 데이터셋 모두에서 최신 일종의 분류 모델을 능가한다.
- 위키백과 데이터셋에서 OCAN은 F1-score 0.886과 AUC 0.943을 기록하여 기존의 일종의 방법들을 능가했다.
- 신용카드 프raud 데이터셋에서 OCAN은 거래 표현을 사용하여 AUC 0.9750을 달성했으며, 모든 기준 모델을 능가했다.
- OCAN은 불균형 데이터에서도 뛰어난 성능을 유지했으며, 원시 특성으로는 AUC 0.9645, 학습된 표현으로는 AUC 0.9750을 기록했다.
- OCAN은 순차적 편집 패턴을 모델링하여 훼손자에 대해 조기 탐지 기능을 보였으며, 감독 학습이 필요한 M-LSTM 모델과 동일한 정확도를 달성했다.
- 거리 분석 결과, 실제 양성 사용자의 중심점과 훼손자 사이의 거리는 3.888이었고, 보완적 샘플까지의 거리는 3.6346였으며, 이는 구분기가 악성 사용자를 효과적으로 분리할 수 있음을 확인한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.