Skip to main content
QUICK REVIEW

[논문 리뷰] TitAnt: Online Real-time Transaction Fraud Detection in Ant Financial

Shaosheng Cao, Xinxing Yang|arXiv (Cornell University)|2019. 06. 18.
Imbalanced Data Classification Techniques참고 문헌 62인용 수 16
한 줄 요약

TitAnt는 안티파이낸셜에서 개발한 실시간 온라인 거래 사기 탐지 시스템으로, 그래프 기반 특징 공학과 기울기 부스팅 결합 결정수형을 활용하여 밀리초 이내의 지연 시간으로 사기를 탐지한다. 이 시스템은 실제 거래 데이터에서 로지스틱 회귀 대비 F1 스코어 최대 4.5% 향상으로 최신 기술 수준의 성능을 달성하며, 대규모 비균형 사기 탐지 환경에서 높은 효과성과 효율성을 입증한다.

ABSTRACT

With the explosive growth of e-commerce and the booming of e-payment, detecting online transaction fraud in real time has become increasingly important to Fintech business. To tackle this problem, we introduce the TitAnt, a transaction fraud detection system deployed in Ant Financial, one of the largest Fintech companies in the world. The system is able to predict online real-time transaction fraud in mere milliseconds. We present the problem definition, feature extraction, detection methods, implementation and deployment of the system, as well as empirical effectiveness. Extensive experiments have been conducted on large real-world transaction data to show the effectiveness and the efficiency of the proposed system.

연구 동기 및 목표

  • 고속 전자결제 시스템에서 실시간, 대규모 온라인 거래 사기 탐지의 과제를 해결하기 위해.
  • 클래스 불균형과 복잡한 사기 패턴을 다루는 데 한계가 있는 규칙 기반 및 전통적 기계학습 방법의 한계를 극복하기 위해.
  • 매일 수십억 건의 거래를 처리할 수 있는 확장성 있고 낮은 지연 시간을 가진 시스템을 설계하기 위해.
  • 감독 학습과 통합된 집계된 트랜잭션 네트워크 특징을 통해 사기 패턴 인식 능력을 향상시키기 위해.
  • 효율적인 분산 컴퓨팅과 하이퍼파라미터 튜닝을 통한 시스템 성능 최적화를 위해.

제안 방법

  • 시스템은 사용자와 계정 간 상호작용을 모델링하기 위해 이질적인 트랜잭션 네트워크를 사용하여 그래프 기반 특징 학습을 가능하게 한다.
  • DeepWalk (DW)는 트랜잭션 네트워크 구조에서 저차원 노드 임베딩을 학습하여 구조적 패턴을 캡처한다.
  • 기본 트랜잭션 특징과 S2V(서브그래프 기반) 및 DW 임베딩을 조합하는 새로운 특징 공학 접근법을 통해 표현을 풍부하게 한다.
  • 불균형 데이터에서 뛰어난 성능을 보이는 점을 고려해 기울기 부스팅 결합 결정수형(GBDT)을 주요 분류기로 사용한다.
  • 쿠펭 하드웨어 기반으로 전용 서버 및 워커 노드로 구성된 하이브리드 아키텍처를 사용해 분산 환경에 시스템을 구축한다.
  • 차원 수, 트리 수, 노드 샘플링 수와 같은 하이퍼파라미터 튜닝을 통해 정확도와 효율성의 균형을 맞춘다.

실험 결과

연구 질문

  • RQ1집계된 트랜잭션 네트워크 특징은 대규모 실시간 시스템에서 사기 탐지 성능을 어떻게 향상시킬 수 있는가?
  • RQ2기본 특징, S2V, DW 임베딩의 최적 조합은 비균형 트랜잭션 데이터에서 사기 탐지에 있어 어떤가?
  • RQ3실제 사기 탐지 작업에서 GBDT는 로지스틱 회귀 및 규칙 기반 모델 대비 F1 스코어와 재현율 측면에서 어떻게 비교되는가?
  • RQ4임베딩 차원 수 및 트리 수와 같은 하이퍼파라미터는 모델 성능과 추론 효율성에 어떤 영향을 미치는가?
  • RQ5생산 환경 유사 조건에서 분산 머신 수가 증가함에 따라 시스템의 확장성과 지연 시간은 어떻게 변화하는가?

주요 결과

  • 4월 16일 데이터에서 기본 특징, DW 임베딩, S2V 특징의 조합을 사용할 경우 GBDT는 로지스틱 회귀 대비 F1 스코어 4.5% 향상.
  • 상위 1% 의심 거래 사례에서 C5.0와 GBDT 모두 재현율 40%를 기록하며, 고립 숲(IF)의 10% 재현율을 크게 뛰어넘음.
  • DeepWalk에서 노드 임베딩의 최적 차원은 32이며, 너무 낮거나 너무 높은 차원에서는 과소적합 및 과적합으로 인해 성능 저하됨.
  • GBDT에서 F1 스코어는 400개의 트리에서 최고치를 보이며, 800개 트리로 증가할수록 성능 저하로 이어져 과적합이 발생함.
  • DeepWalk에서 100개 노드 샘플링 시 성능이 안정화되며, 200개로 늘릴 경우 계산 시간이 두 배로 증가하지만 성능 향상은 미미함.
  • 시스템은 밀리초 이내 실시간 예측을 달성하며, 머신 수가 증가할수록 지연 시간이 감소하지만, 통신 오버헤드로 인해 선형적 성능 향상은 제한됨.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.