Skip to main content
QUICK REVIEW

[논문 리뷰] Truncated Affinity Maximization: One-class Homophily Modeling for Graph Anomaly Detection

Qiao Hezhe, Guansong Pang|arXiv (Cornell University)|2023. 05. 29.
Complex Network Analysis Techniques인용 수 4
한 줄 요약

이 논문은 반복적으로 잘라낸 그래프에서 친화도 최대화를 통해 맞춤형 노드 표현을 학습함으로써 정상 노드가 상호 간에 강한 국소적 친화도를 보이는 일종의 동류성(One-class homophily)을 활용하는 새로운 비지도 그래프 이상 탐지 방법인 Truncated Affinity Maximization(TAM)을 소개한다. TAM은 기존 방법들과 비교해 도전적인 실세계 데이터셋에서 AUROC와 AUPRC를 각각 10퍼센트 이상 향상시키며 최첨단 성능을 달성한다.

ABSTRACT

We reveal a one-class homophily phenomenon, which is one prevalent property we find empirically in real-world graph anomaly detection (GAD) datasets, i.e., normal nodes tend to have strong connection/affinity with each other, while the homophily in abnormal nodes is significantly weaker than normal nodes. However, this anomaly-discriminative property is ignored by existing GAD methods that are typically built using a conventional anomaly detection objective, such as data reconstruction. In this work, we explore this property to introduce a novel unsupervised anomaly scoring measure for GAD, local node affinity, that assigns a larger anomaly score to nodes that are less affiliated with their neighbors, with the affinity defined as similarity on node attributes/representations. We further propose Truncated Affinity Maximization (TAM) that learns tailored node representations for our anomaly measure by maximizing the local affinity of nodes to their neighbors. Optimizing on the original graph structure can be biased by nonhomophily edges (i.e., edges connecting normal and abnormal nodes). Thus, TAM is instead optimized on truncated graphs where non-homophily edges are removed iteratively to mitigate this bias. The learned representations result in significantly stronger local affinity for normal nodes than abnormal nodes. Extensive empirical results on 10 real-world GAD datasets show that TAM substantially outperforms seven competing models, achieving over 10% increase in AUROC/AUPRC compared to the best contenders on challenging datasets. Our code is available at https://github.com/mala-lab/TAM-master/.

연구 동기 및 목표

  • 실세계 그래프 이상 탐지(GAD) 데이터셋에서 이전에 간과된 이상 탐지에 유용한 성질인 일종의 동류성(One-class homophily)이 존재하는지 확인하는 것: 정상 노드는 상호 간에 강한 친화도를 보이며, 이상 노드는 내부적으로 약한 친화도를 보인다.
  • 노드의 속성 또는 표현 공간에서 이웃과의 유사도가 낮을수록 높은 이상도 점수를 할당하는 새로운 비지도 이상 탐지 점수 측정법인 국소적 노드 친화도를 개발하는 것.
  • 표준 GNN에서 표현 품질을 떨어뜨리는 비동류성 간선(정상 노드와 이상 노드를 연결하는 간선)으로 인한 편향 문제를 해결하기 위해 학습 중에 이러한 간선을 제거하는 그래프 잘라내기 전략을 제안하는 것.
  • 잘라낸 그래프에서 국소적 노드 친화도를 최대화하는 새로운 목적함수를 최적화하여 노드 표현을 종합적으로 최적화함으로써 정상 노드와 이상 노드 간의 분리도를 향상시키는 것.
  • 대규모 및 숨겨진 속성 설정에서 제안된 방법의 강건성과 확장성을 입증하는 것.

제안 방법

  • 노드 표현 공간에서 노드와 이웃 간의 코사인 유사도를 기반으로 국소적 노드 친화도를 이상도 점수로 제안하며, 친화도가 낮을수록 이상 가능성은 높아진다.
  • 각 노드가 이웃과 표현 공간에서 평균적으로 더 높은 유사도를 가지도록 하는 트레이닝 목표인 Truncated Affinity Maximization(TAM)을 도입한다.
  • 정상 노드와 이상 노드를 연결하는 간선(비동류성 간선)을 제거하기 위해 반복적인 그래프 잘라내기를 적용하여 표현의 균일화를 방지하고 최적화 편향을 줄인다.
  • GNN 인코더를 사용해 잘라낸 그래프에서 TAM 목표함수를 통해 종합적으로 최적화된 노드 표현을 학습함으로써 정상 노드의 친화도를 향상시키고 이상 노드의 친화도를 억제한다.
  • 다양한 잘라낸 깊이에서의 이상도 점수를 다중 척도 집계 전략으로 통합하여 강건성과 성능을 향상시킨다.
  • 비교를 위한 기준으로 자기지도 대비 목적함수(DGI)를 활용하지만, 일종의 동류성에 기반한 더 나은 표현 학습을 통해 TAM의 우월성을 입증한다.

실험 결과

연구 질문

  • RQ1실세계 그래프 이상 탐지 데이터셋에서 정상 노드는 상호 간에 강한 친화도를 보이며 이상 노드는 그렇지 않은 일종의 동류성(One-class homophily)이 존재하는가?
  • RQ2표현 공간에서 이웃과의 유사도로 정의되는 국소적 노드 친화도가 효과적인 비지도 이상 탐지 점수 측정법이 될 수 있는가?
  • RQ3비동류성 간선을 제거하기 위해 반복적인 그래프 잘라내기를 적용하면 노드 표현의 품질이 이상 탐지에 있어 향상되는가?
  • RQ4기존의 재구성 또는 자기지도 목적함수와 비교해 잘라낸 그래프에서 국소적 친화도를 최적화하면 정상 노드와 이상 노드 간의 분리도가 향상되는가?
  • RQ5악성 노드가 정상 노드의 특징을 모방하는 속성 숨겨짐 환경에서 제안된 방법의 강건성은 어떠한가?

주요 결과

  • TAM은 10개의 실세계 GAD 데이터셋에서 기준 방법 중 최고 성능을 기록한 방법보다 평균 AUROC가 10.5% 향상되고 AUPRC가 12.5% 향상되었다.
  • OGB-Proteins 데이터셋에서 TAM은 AUROC 0.7449와 AUPRC 0.2173를 기록했으며, 두 번째로 좋은 방법(SL-GAD)보다 AUROC 1.8%와 AUPRC 4.2% 높게 기록했다.
  • 대규모 그래프(예: Amazon-all, YelpChi-all)에서 TAM은 각각 AUROC 0.8476과 0.5818의 높은 성능을 유지했으며, 모든 기준 방법보다 뚜렷하게 뛰어났다.
  • 30%의 속성 숨겨짐 조건에서도 TAM은 BlogCatalog에서 AUROC 0.7831, Facebook에서 AUROC 0.8650을 기록해 기능 수준의 적대적 조작에 강건함을 입증했다.
  • 제거 실험 결과 그래프 잘라내기가 필수적임을 확인: 잘라내기를 제거하면 평균 AUROC가 15% 감소했으며, 이는 비동류성 간선이 성능에 심각한 영향을 미친다는 것을 시사한다.
  • 다중 척도 점수 집계는 AUROC 기준 최대 8% 향상시키며, 다양한 잘라낸 깊이에서의 결과를 통합함으로써 강건성이 향상됨을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.