Skip to main content
QUICK REVIEW

[논문 리뷰] Anomaly Detection in Networks with Application to Financial Transaction Networks

Andrew Elliott, Mihai Cucuringu|arXiv (Cornell University)|2019. 01. 02.
Network Security and Intrusion Detection참고 문헌 55인용 수 17
한 줄 요약

이 논문은 네트워크 비교와 스펙트럼 분석을 융합하여 재무 거래 네트워크에 대한 새로운 이상 탐지 방법을 제안한다. 이 방법은 140개의 특징을 추출하고, 이를 특징 합 또는 랜덤 포레스트 분류기와 함께 사용하여 알려지지 않은 이상 현상을 식별한다. 기존의 Oddball 등의 접근 방식보다 뛰어나며, 합성 데이터셋에서 상위 2% 순위에 속한 노드들 중 90퍼센트 이상의 심기된 이상 현상을 탐지한다.

ABSTRACT

This paper is motivated by the task of detecting anomalies in networks of financial transactions, with accounts as nodes and a directed weighted edge between two nodes denoting a money transfer. The weight of the edge is the transaction amount. Examples of anomalies in networks include long paths of large transaction amounts, rings of large payments, and cliques of accounts. There are many methods available which detect such specific structures in networks. Here we introduce a method which is able to detect previously unspecified anomalies in networks. The method is based on a combination of features from network comparison and spectral analysis as well as local statistics, yielding 140 main features. We then use a simple feature sum method, as well as a random forest method, in order to classify nodes as normal or anomalous. We test the method first on synthetic networks which we generated, and second on a set of synthetic networks which were generated without the methods team having access to the ground truth. The first set of synthetic networks was split in a training set of 70 percent of the networks, and a test set of 30 percent of the networks. The resulting classifier was then applied to the second set of synthetic networks. We compare our method with Oddball, a widely used method for anomaly detection in networks, as well as to random classification. While Oddball outperforms random classification, both our feature sum method and our random forest method outperform Oddball. On the test set, the random forest outperforms feature sum, whereas on the second synthetic data set, initially feature sum tends to pick up more anomalies than random forest, with this behaviour reversing for lower-scoring anomalies. In all cases, the top 2 percent of flagged anomalies contained on average over 90 percent of the planted anomalies.

연구 동기 및 목표

  • 기존의 규칙 기반 또는 패턴 전용 방법으로는 포착되지 않는 재무 거래 네트워크 내의 사전에 알려지지 않은 이상 현상을 탐지하기 위해.
  • 이상 패턴에 대한 사전 지식 없이도 다양한 네트워크 구조에 일반적으로 적용 가능한 이상 탐지 프레임워크를 개발하기 위해.
  • 다양한 네트워크 특징과 기계 학습 분류를 통합하여 기존 최고 수준의 방법인 Oddball보다 성능을 향상시키기 위해.
  • 이상 패턴이 명시적으로 심어진 합성 네트워크에서의 성능을 평가하여 강건성과 신뢰성을 확보하기 위해.
  • 심기된 이상 구조에 포함되지 않은데도 이상으로 분류된 노드들을 분석하여 잠재적 오진 탐지 원인을 규명하기 위해.

제안 방법

  • 이 방법은 네트워크 비교 지표(예: 그래프 거리, 엣지 기반 차이)와 스펙트럼 분석(예: 고유벡터 국지화, 모듈래리티 행렬 성질)을 조합하여 140개의 특징을 생성한다.
  • 고유벡터의 ℓ₁ 노름 z-스코어를 사용하여 스펙트럼 국지화를 탐지하며, 이는 네트워크 내에서 이상 노드의 집중 현상의 징후로 간주된다.
  • 특징들은 단순한 합(Feature sum)과 랜덤 포레스트 분류기를 통해 집계되어 노드를 정상 또는 이상으로 순위 매기고 분류한다.
  • 이 방법은 두 개의 합성 데이터셋을 기반으로 검증되었으며, 훈련용 데이터셋(70%)과 개발 과정에서 생성 메커니즘이 알려지지 않은 독립적인 테스트 세트(30%)로 구성되어 있다.
  • 이상으로 분류된 노드의 국소 네트워크 이웃을 탐색하기 위해 2-호프 스노우볼 샘플링 절차를 포함하여, 임베딩되지 않은 이상 현상의 시각적 및 통계적 분석을 가능하게 한다.
  • 성능 평가에는 표준 지표인 재현율(recall), 정밀도(precision), 평균 정밀도를 사용하였으며, 오차 막대는 100개의 테스트 네트워크에 걸친 표준 오차를 나타낸다.

실험 결과

연구 질문

  • RQ1네트워크 비교와 스펙트럼 분석을 융합한 하이브리드 방법이 기존 방법보다 재무 거래 네트워크에서 알려지지 않은 이상 패턴을 더 효과적으로 탐지할 수 있는가?
  • RQ2다양한 합성 네트워크 구성에서 특징 합과 랜덤 포레스트 분류기의 이상 탐지 성능는 어떻게 비교되는가?
  • RQ3이상 패턴이 명시적으로 심어지지 않은 경우에도, 이 방법이 진정으로 이상인 노드를 얼마나 잘 식별하면서 오진을 최소화할 수 있는가?
  • RQ4분류기에서 상위 순위에 올라간 노드들이 다양한 매개변수 영역에서 실제 심기된 이상 현상과 비교해 재현율과 정밀도 측면에서 어떻게 성능을 보이는가?
  • RQ5심기된 이상에 포함되지 않은 채로 이상으로 분류된 노드들은 그들의 국소 네트워크 이웃에서 어떤 구조적 특성을 보이는가?

주요 결과

  • 독립적인 테스트 세트에서 랜덤 포레스트 분류기가 특징 합 방법보다 정밀도와 F1-스코어 측면에서 뛰어난 성능을 보였다.
  • 두 번째 합성 데이터셋에서 특징 합은 초기에는 랜덤 포레스트보다 더 많은 이상 현상을 탐지했지만, 낮은 점수를 받는 이상 현상에서는 이 경향이 뒤집히며 민감도 측면에서의 상호 보완적 특성이 드러났다.
  • 모든 테스트 시나리오에서 상위 2% 순위에 속한 노드들이 평균적으로 심기된 이상 현상의 90퍼센트 이상을 포함하여, 높은 탐지 효율성을 입증했다.
  • 모든 매개변수 영역에서 랜덤 분류 및 널리 사용되는 Oddball 방법보다 이 방법이 재현율과 정밀도 측면에서 뚜렷이 뛰어났다.
  • 심기된 이상에 포함되지 않은 채로 이상으로 분류된 노드들은 2-호프 이웃에서 명백한 구조적 패턴을 보이지 않아, 이 방법이 미세하고 명백하지 않은 이상 현상을 탐지할 수 있음을 시사한다.
  • 특히 ℓ₁ 노름 z-스코어를 통한 고유벡터 국지화를 포함한 스펙트럼 특징의 활용이, 기존 네트워크 통계로는 탐지되지 않는 이상 노드를 식별하는 데 기여한 것으로 나타났다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.