Skip to main content
QUICK REVIEW

[논문 리뷰] Sequential Behavioral Data Processing Using Deep Learning and the Markov Transition Field in Online Fraud Detection

Ruinan Zhang, Fanglan Zheng|arXiv (Cornell University)|2018. 08. 16.
Time Series Analysis and Forecasting참고 문헌 1인용 수 19
한 줄 요약

이 논문은 웹 및 모바일 플랫폼의 순차적 행동 데이터를 사용하여 온라인 사기 탐지 성능을 향상시키기 위해 장기 숏텀 기억(LSTM) 네트워크와 합성곱 신경망(CNN)을 조합한 하이브리드 딥 러닝 모델을 제안한다. 이 방법은 사용자 상호작용 시퀀스를 상태 간 전이 확률을 캡처하는 전이 필드(MTF) 행렬로 인코딩하며, 이를 통해 CNN이 공간적 패턴 학습을 수행하고, LSTMs가 시간적 순서를 유지한다. 통합된 모델은 다층 퍼셉트론 대비 23% 향상된 사기 예측 AUC를 기록했고, 단일 RNN 대비 7% 향상되었다.

ABSTRACT

Due to the popularity of the Internet and smart mobile devices, more and more financial transactions and activities have been digitalized. Compared to traditional financial fraud detection strategies using credit-related features, customers are generating a large amount of unstructured behavioral data every second. In this paper, we propose an Recurrent Neural Netword (RNN) based deep-learning structure integrated with Markov Transition Field (MTF) for predicting online fraud behaviors using customer's interactions with websites or smart-phone apps as a series of states. In practice, we tested and proved that the proposed network structure for processing sequential behavioral data could significantly boost fraud predictive ability comparing with the multilayer perceptron network and distance based classifier with Dynamic Time Warping(DTW) as distance metric.

연구 동기 및 목표

  • 웹 및 모바일 플랫폼에서 생성되는 고차원적이고 비정형적인 순차적 행동 데이터를 활용해 온라인 사기를 탐지하는 데 도전하는 것.
  • 시간-시퀀스 패턴 인식을 위한 딥 러닝의 활용을 통해 기존 모델(예: 로지스틱 회귀 및 DTW 기반 k-NN)의 한계를 극복하는 것.
  • 사용자 상호작용 시퀀스 내 상태 간 전이 확률과 시간적 순서를 모두 유지하는 새로운 아키텍처를 설계하는 것.
  • MTF 인코딩과 CNN 및 RNN 구성 요소를 통합함으로써 사기 예측 정확도 향상 효과를 평가하는 것.
  • 기본 모델 대비 실세계 금융 거래 데이터에서 뛰어난 성능을 보여주는 것.

제안 방법

  • 각 특성에 대해 원핫 인코딩을 사용하여 사용자 상호작용 시퀀스를 이진 벡터로 인코딩하여 다양한 데이터 유형 간 도메인 전문 지식을 유지한다.
  • 크기가 l×l인 마르코프 전이 필드(MTF) 행렬을 구성하며, 각 요소는 시퀀스 내 한 상태에서 다른 상태로의 전이 확률을 나타낸다.
  • MTF 행렬을 2차원 합성곱 신경망(CNN)에 입력하며, 평균 풀링을 사용하여 확률적 전이 정보를 유지하고 최대 풀링에 의한 정보 손실을 방지한다.
  • 원래의 인코딩된 상태 시퀀스를 처리하여 시간적 의존성과 순서를 모델링하기 위해 LSTM 기반의 RNN을 사용한다.
  • 최종 분류기는 MTF에 대한 CNN의 특징과 원시 시퀀스에 대한 RNN의 특징을 결합하여 통합된 사기 예측을 수행한다.
  • 모델은 사용자 세션의 배치 기반 순차 데이터로 엔드 투 엔드로 훈련되며, 성능 평가에는 코모고로프-스미르노프(KS) 점수와 AUC가 사용된다.

실험 결과

연구 질문

  • RQ1MTF 인코딩과 CNN 및 RNN 구성 요소를 통합한 딥 러닝 모델이 순차적 행동 데이터에서 온라인 사기를 탐지하는 데 있어 기존 분류기보다 우월한가?
  • RQ2마르코프 전이 필드(MTF)가 고차원적이고 다변량 행동 시퀀스에서 의미 있는 전이 패턴을 얼마나 잘 유지하는가?
  • RQ3MTF 기반 CNN과 RNN을 통합함으로써 사기 탐지 성능 향상 정도는 얼마나 되는가? 단일 모델 대비 성능 향상 정도를 평가한다.
  • RQ4실시간 금융 플랫폼에서 유입되는 고차원적 스트리밍 행동 데이터를 처리할 때 제안된 아키텍처가 예측 성능를 유지하는가?
  • RQ5다층 퍼셉트론 및 DTW 기반 k-NN와 같은 기준 모델 대비 사기 탐지 성능 향상 정도는 얼마나 되는가?

주요 결과

  • 제안된 하이브리드 모델은 다층 퍼셉트론 기준 모델 대비 사기 예측 AUC를 23% 향상시켰다.
  • 단일 RNN 모델 대비 AUC에서 7% 향상된 결과를 기록하여 MTF-CNN과 RNN 구성 요소의 조합이 유의미한 이점을 제공함을 입증했다.
  • 코모고로프-스미르노프(KS) 점수는 기준 모델의 0.17에서 제안 모델의 0.21로 상승하여 강력한 분류 능력을 보였다.
  • MTF-CNN 구성 요소는 사용자 행동 간 전역 전이 패턴을 효과적으로 포착했고, RNN은 국소적 순차적 의존성을 유지했다.
  • 플랫팅된 세션당 100만 개 이상의 특징을 포함하는 실세계 데이터셋에서도 모델은 뛰어난 강건성과 확장성을 보였다.
  • CNN 레이어에서 평균 풀링을 사용함으로써 핵심 확률 전이 정보를 유지했고, 이는 최대 풀링 대비 이 분야에서 더 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.