Skip to main content
QUICK REVIEW

[논문 리뷰] DeepTrax: Embedding Graphs of Financial Transactions

C. Bayan Bruss, Anish Khazane|arXiv (Cornell University)|2019. 07. 16.
Advanced Graph Neural Networks참고 문헌 29인용 수 9
한 줄 요약

이 논문은 계좌와 상점 간의 이원 그래프로 신용카드 거래를 모델링하는 DeepTrax를 제안한다. 시간 제약이 있는 거래 쌍을 사용해 스위프트그램 모델을 통해 노드 임베딩을 훈련한다. 이 방법은 지출 패턴, 지리적 위치, 상점 카테고리 등을 반영하는 의미적으로 유의미한 저차원 벡터를 생성하며, 링크 예측(AUC 및 F1) 성능이 뛰어나고, 특징으로 사용될 경우 사기 탐지 성능을 5.2% 향상시킨다.

ABSTRACT

Financial transactions can be considered edges in a heterogeneous graph between entities sending money and entities receiving money. For financial institutions, such a graph is likely large (with millions or billions of edges) while also sparsely connected. It becomes challenging to apply machine learning to such large and sparse graphs. Graph representation learning seeks to embed the nodes of a graph into a Euclidean vector space such that graph topological properties are preserved after the transformation. In this paper, we present a novel application of representation learning to bipartite graphs of credit card transactions in order to learn embeddings of account and merchant entities. Our framework is inspired by popular approaches in graph embeddings and is trained on two internal transaction datasets. This approach yields highly effective embeddings, as quantified by link prediction AUC and F1 score. Further, the resulting entity vectors retain intuitive semantic similarity that is explored through visualizations and other qualitative analyses. Finally, we show how these embeddings can be used as features in downstream machine learning business applications such as fraud detection.

연구 동기 및 목표

  • 수백만 개의 엔티티를 포함한 대규모 희소 금융 거래 그래프에 머신러닝을 적용하는 데 도전하는 데 목적을 두며.
  • 위계적 및 의미적 구조를 유지하는 고밀도 저차원 임베딩을 계좌 및 상점 엔티티에 대해 학습하는 데 목적을 두며.
  • 이러한 임베딩이 사기 탐지 및 링크 예측과 같은 후행 작업에서 얼마나 유용한지 평가하는 데 목적을 두며.
  • 지리적 및 카테고리적 패턴이 명시적인 특징 공학 없이도 임베딩 공간에서 자연스럽게 발생하는지 입증하는 데 목적을 두며.

제안 방법

  • 이 방법은 고정된 시간 창(예: 50초) 내에 동일한 계좌가 두 개의 상점과 모두 거래할 경우 그 상점 간에 간선을 형성하는 이원 그래프를 구성한다.
  • 음성 샘플링을 사용한 스위프트그램 모델을 적용하여 노드 임베딩을 학습하며, 거래 시퀀스를 컨텍스트 윈도우로 간주한다.
  • 모델은 두 개의 내부 거래 데이터셋에서 훈련되어 거래 행동과 근접도를 캐릭터라이징하는 표현을 학습한다.
  • 구조적 보존 정도를 측정하기 위해 링크 예측 AUC 및 F1 점수를 사용해 임베딩을 평가한다.
  • 상점 임베딩을 사기 탐지 모델의 특징으로 사용하는 전이 학습 설정으로 프레임워크를 확장한다.
  • 특징 공간의 확장을 줄이면서 성능을 향상시키기 위해 압축을 위한 보조 트레이너블 MLP를 사용한다.

실험 결과

연구 질문

  • RQ1그래프 임베딩 기법이 의미적인 구조를 유지하는 대규모 희소 금융 거래 네트워크를 효과적으로 표현할 수 있는가?
  • RQ2학습된 임베딩이 명시적인 특징 없이도 상점 간의 지리적 및 카테고리적 유사성을 어느 정도 반영하는가?
  • RQ3기본 모델 대비 사기 탐지와 같은 후행 작업으로 일반화된 임베딩의 성능은 어떠한가?
  • RQ4MLP를 통해 압축된 임베딩 표현이 특징 공간 성장 최소화와 함께 예측 능력을 유지할 수 있는가?

주요 결과

  • 모델은 높은 AUC 및 F1 점수를 기록하여 링크 예측 성능이 뛰어나며, 임베딩 공간에서 그래프 위상의 효과적인 보존을 나타낸다.
  • 지리적 거리가 명시된 특징 없이도 동일한 우편번호에 속한 상점들이 임베딩 공간에서 자연스럽게 군집화되어 있음을 확인할 수 있다.
  • 지역적 특성과 문화적 뉘앙스를 반영하는 것으로, 포틀랜드의 맥주 양조장 집중 또는 로스앤젤레스의 커피숍 분포 등이 나타난다.
  • 원시 상점 임베딩을 직접 사용할 경우 기준 모델 대비 사기 탐지 AUpr 성능이 약 1.0% 향상된다.
  • 압축을 위한 트레이너블 MLP를 사용해 임베딩을 단일 사기 점수로 변환하면 사기 탐지 효능이 5.2% 향상되며, 효과적인 전이 학습을 입증한다.
  • 서로 다른 문자열 표현(예: DUNKIN #341663 Q와 Q35)을 가진 동일하거나 유사한 상점 이름들이 클러스터링되는 것으로 나타나, 직관적인 엔티티 해소가 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.