Skip to main content
QUICK REVIEW

[論文レビュー] Truncated Affinity Maximization: One-class Homophily Modeling for Graph Anomaly Detection

Qiao Hezhe, Guansong Pang|arXiv (Cornell University)|May 29, 2023
Complex Network Analysis Techniques被引用数 4
ひとこと要約

本稿では、反復的に切断されたグラフ上で局所的同型性の最大化を学習することで、適合したノード表現を学ぶことで、1クラスの同型性(正常ノード同士が強い局所的親和性を示す)を活用する、新しい非教師付きグラフ異常検出手法であるTruncated Affinity Maximization (TAM)を提案する。TAMは、既存手法と比較して、困難な実世界のデータセットにおいて、AUROCとAUPRCの両方で10%以上の向上を達成し、最先端の性能を発揮する。

ABSTRACT

We reveal a one-class homophily phenomenon, which is one prevalent property we find empirically in real-world graph anomaly detection (GAD) datasets, i.e., normal nodes tend to have strong connection/affinity with each other, while the homophily in abnormal nodes is significantly weaker than normal nodes. However, this anomaly-discriminative property is ignored by existing GAD methods that are typically built using a conventional anomaly detection objective, such as data reconstruction. In this work, we explore this property to introduce a novel unsupervised anomaly scoring measure for GAD, local node affinity, that assigns a larger anomaly score to nodes that are less affiliated with their neighbors, with the affinity defined as similarity on node attributes/representations. We further propose Truncated Affinity Maximization (TAM) that learns tailored node representations for our anomaly measure by maximizing the local affinity of nodes to their neighbors. Optimizing on the original graph structure can be biased by nonhomophily edges (i.e., edges connecting normal and abnormal nodes). Thus, TAM is instead optimized on truncated graphs where non-homophily edges are removed iteratively to mitigate this bias. The learned representations result in significantly stronger local affinity for normal nodes than abnormal nodes. Extensive empirical results on 10 real-world GAD datasets show that TAM substantially outperforms seven competing models, achieving over 10% increase in AUROC/AUPRC compared to the best contenders on challenging datasets. Our code is available at https://github.com/mala-lab/TAM-master/.

研究の動機と目的

  • 実世界のグラフ異常検出(GAD)データセットにおいて、これまで無視されてきた異常特徴を示す性質、すなわち1クラスの同型性(正常ノード同士は強く関連しているが、異常ノードは内部的に弱い同型性を示す)が存在するかを同定すること。
  • 属性または表現空間における近隣ノードとの類似性が低いノードに高いスコアを割り当てる、局所的ノード親和性と呼ばれる新しい非教師付き異常スコア測定法を考案すること。
  • 標準的なGNNで表現品質を低下させる非同型性エッジ(正常ノードと異常ノードを接続するエッジ)に起因するバイアスを解消するため、トレーニング中にこのようなエッジを除去するグラフ切断戦略を提案すること。
  • 切断されたグラフ上で局所的ノード親和性を最大化する新しい目的関数を最適化することで、ノード表現をエンドツーエンドに最適化し、正常ノードと異常ノードの分離を向上させること。
  • 大規模なグラフおよび隠蔽された属性設定において、提案手法の頑健性とスケーラビリティを実証すること。

提案手法

  • ノードとその近隣ノードの表現空間におけるコサイン類似度に基づく局所的ノード親和性を異常スコアとして提案し、親和性が低いほど異常度が高くなるように定義する。
  • 各ノードがその近隣ノードと表現空間で示す平均類似度を最大化するという目的関数として、Truncated Affinity Maximization (TAM) を導入する。
  • 正常ノードと異常ノードを接続するエッジ(非同型性エッジ)を除去するために、反復的なグラフ切断を適用し、表現の均一化を防ぎ、最適化バイアスを低減する。
  • GNNエンコーダを用いてノード表現を学習し、切断されたグラフ上でTAM目的関数をエンドツーエンドに最適化することで、正常ノードの親和性を高めるとともに、異常ノードの親和性を抑制する。
  • 異なる切断深さにおける異常スコアを統合するマルチスケールアグリゲーション戦略を採用し、頑健性と性能を向上させる。
  • 比較のためのベースラインとして自己教師型対照的目的(DGI)を活用するが、1クラスの同型性に基づくより優れた表現学習を実現するTAMの優位性を示す。

実験結果

リサーチクエスチョン

  • RQ1実世界のグラフ異常検出データセットに、正常ノード同士が強く関連しているが異常ノード同士は関連が薄い1クラスの同型性が存在するか?
  • RQ2表現空間における近隣ノードとの類似度として定義される局所的ノード親和性は、有効な非教師付き異常スコア測定法として機能するか?
  • RQ3非同型性エッジを除去する反復的グラフ切断により、異常検出のためのノード表現品質が向上するか?
  • RQ4切断されたグラフ上で局所的親和性を最適化することで、標準的な再構成または自己教師型目的と比較して、正常ノードと異常ノードの分離が向上するか?
  • RQ5悪意のあるノードが正常ノードの特徴を模倣する属性の隠蔽(camouflaging)に対して、提案手法はどの程度頑健か?

主な発見

  • TAMは、10個の実世界GADデータセットにおいて、最良のベースライン手法と比較して、AUROCで平均10.5%、AUPRCで平均12.5%の向上を達成した。
  • OGB-Proteinsデータセットでは、AUROCが0.7449、AUPRCが0.2173を達成し、2番目に優れた手法(SL-GAD)をAUROCで1.8%、AUPRCで4.2%上回った。
  • 大規模グラフ(例:Amazon-all、YelpChi-all)においても、それぞれAUROCが0.8476および0.5818を達成し、すべてのベースラインを顕著に上回った。
  • 30%の属性隠蔽条件下でも、BlogCatalogではAUROCが0.7831、Facebookでは0.8650を維持し、特徴レベルの敵対的操作に対して頑健であることを示した。
  • アブレーションスタディの結果、グラフ切断は不可欠であることが確認された。切断を除去すると、平均でAUROCが15%低下し、非同型性エッジが性能を著しく劣化させることを示している。
  • マルチスケールスコア統合により、AUROCで最大8%の性能向上が達成され、異なる切断深さからの結果を統合することで頑健性が向上することを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。