Skip to main content
QUICK REVIEW

[論文レビュー] LUNAR: Unifying Local Outlier Detection Methods via Graph Neural Networks

Adam Goodge, Bryan Hooi|arXiv (Cornell University)|Dec 10, 2021
Anomaly Detection Techniques and Applications被引用数 8
ひとこと要約

LUNAR は、LOF や KNN などの局所的外れ値手法を統一するグラフニューラルネットワークベースの異常検出手法を提案する。これにより、学習可能で適応可能な近隣集約が可能となり、表形式データにおいて最先端の性能を達成するとともに、従来の手法に比べて近隣サイズのハイパーパrameterに対して著しく高いロバスト性を示す。

ABSTRACT

Many well-established anomaly detection methods use the distance of a sample to those in its local neighbourhood: so-called `local outlier methods', such as LOF and DBSCAN. They are popular for their simple principles and strong performance on unstructured, feature-based data that is commonplace in many practical applications. However, they cannot learn to adapt for a particular set of data due to their lack of trainable parameters. In this paper, we begin by unifying local outlier methods by showing that they are particular cases of the more general message passing framework used in graph neural networks. This allows us to introduce learnability into local outlier methods, in the form of a neural network, for greater flexibility and expressivity: specifically, we propose LUNAR, a novel, graph neural network-based anomaly detection method. LUNAR learns to use information from the nearest neighbours of each node in a trainable way to find anomalies. We show that our method performs significantly better than existing local outlier methods, as well as state-of-the-art deep baselines. We also show that the performance of our method is much more robust to different settings of the local neighbourhood size.

研究の動機と目的

  • LOF、KNN、DBSCAN などの多様な局所的外れ値検出手法を、グラフニューラルネットワークに基づく共通のメッセージパッシングフレームワークに統一すること。
  • 従来の局所的外れ値手法が固定されたヒューリスティクスとハイパーパrameterに依存し、データに適応できないという欠点を解消すること。
  • 動的に近隣からの情報を集約するための新しいトレーニング可能な異常検出モデルを構築すること。
  • 実世界の表形式データセットにおいて、従来の手法および深層学習ベースのベースラインと比較して優れた性能とロバスト性を示すことを実証すること。

提案手法

  • LUNAR は、データポイントをグラフ上のノードとしてモデル化し、各ポイントをその k 個の最近傍点と接続するエッジで結ぶ。
  • 学習可能なメッセージパッシング層を備えたグラフニューラルネットワークを用いて、近隣ノードからの特徴を統合し、一元的な異常スコアを生成する。
  • 従来の手法が固定ルール(例:k 番目の距離や密度比)を用いるのに対し、LUNAR はすべての k 個の近隣からのメッセージを処理する学習可能な集約メカニズムを採用する。
  • トレーニングの安定性と一般化性能を向上させるために、部分空間の摂動と一様サンプリングの負例サンプリング戦略を組み込む。
  • 最終的な異常スコアは、シグモイド活性化関数を用いた最終層によって計算され、Adam 最適化を用いた平均二乗誤差損失関数でモデルを訓練する。

実験結果

リサーチクエスチョン

  • RQ1LOF、KNN、DBSCAN などの従来の局所的外れ値検出手法を、グラフニューラルネットワークに基づく一貫したメッセージパッシングフレームワークに統一できるか?
  • RQ2近隣集約プロセスに学習可能なパラメータを導入することで、表形式データにおける異常検出性能が著しく向上するか?
  • RQ3LUNAR の手法は、従来の局所的外れ値手法と比較して、近隣サイズハイパーパramータ k の変動に対してどれほどロバストか?
  • RQ4異なる負例サンプリング戦略が、モデルの性能と一般化性能に与える影響は何か?

主な発見

  • SATELLITE を除くすべてのデータセットで最高の AUC スコアを達成し、HRSS、MI-V、THYROID では統計的に有意な改善(p < 0.01)を示した。
  • HRSS、MI-V、THYROID では、2番目に優れた手法に比べて AUC で 10~30 パcent 点の優位性を示した。
  • k を 2 から 200 に増加させた場合、LUNAR は AUC がたった 3 パcent 点低下するのに対し、LOF、KNN、DN2 は 24~26 パcent 点低下し、優れたロバスト性を示した。
  • 部分空間の摂動と一様サンプリングの組み合わせが、大多数のデータセットで最高の性能を発揮した。SP 単体では、k が小さい OPTDIGITS でのみ性能が低かった。
  • メッセージ集約に深いおよび広い GNN アーキテクチャを用いることで、アブレーションスタディの結果、性能が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。