Skip to main content
QUICK REVIEW

[論文レビュー] Provable Self-Representation Based Outlier Detection in a Union of Subspaces

Chong You, Daniel P. Robinson|arXiv (Cornell University)|Apr 12, 2017
Anomaly Detection Techniques and Applications参考文献 11被引用数 11
ひとこと要約

本稿では、表現係数から有向グラフを構築し、ランダムウォークを用いて外れ値を特定することで、部分空間の和におけるスパース自己表現を活用する、R-graphと呼ばれる新しい外れ値検出手法を提案する。この手法は幾何学的および接続性の仮定の下で外れ値を正当に検出でき、特に高次元データにおけるマルチサブスペース設定において、最先端の手法を上回る性能を発揮する。

ABSTRACT

Many computer vision tasks involve processing large amounts of data contaminated by outliers, which need to be detected and rejected. While outlier detection methods based on robust statistics have existed for decades, only recently have methods based on sparse and low-rank representation been developed along with guarantees of correct outlier detection when the inliers lie in one or more low-dimensional subspaces. This paper proposes a new outlier detection method that combines tools from sparse representation with random walks on a graph. By exploiting the property that data points can be expressed as sparse linear combinations of each other, we obtain an asymmetric affinity matrix among data points, which we use to construct a weighted directed graph. By defining a suitable Markov Chain from this graph, we establish a connection between inliers/outliers and essential/inessential states of the Markov chain, which allows us to detect outliers by using random walks. We provide a theoretical analysis that justifies the correctness of our method under geometric and connectivity assumptions. Experimental results on image databases demonstrate its superiority with respect to state-of-the-art sparse and low-rank outlier detection methods.

研究の動機と目的

  • 高次元データにおける外れ値検出の課題に取り組む。ここでの内側の点(inliers)は低次元部分空間の和に存在する。
  • 単一の低ランク部分空間を仮定する既存手法の制限や、計算コストの高い凸最適化に依存する手法の限界を克服する。
  • 自己表現とグラフベースのランダムウォークを活用した、理論的裏付けがあり、効率的な外れ値検出手法を開発する。
  • 実世界のデータセット(Extended Yale Bなど)における外れ値の割合の変動や照明変動に対して、頑健性を確保する。

提案手法

  • ℓ₁最小化を用いて得られるスパース表現係数から、非対称な類似度行列を構築し、各データ点が他の点のスパース線形結合として表現されることを保証する。
  • 表現行列から重み付き有向グラフを構築し、エッジは点間の自己表現の強さを反映する。
  • グラフ上にマルコフ連鎖を定義し、内側の点(inliers)を必須状態(essential states)とし、外れ値(outliers)を非必須状態(inessential states)としてモデル化することで、ランダムウォークの吸収確率を用いた確率的外れ値検出を可能にする。
  • ランダムウォークの収束を用いて外れ値を特定する:訪問確率が低い点は外れ値としてフラグを立てる。これはグラフ内の構造的接続性を活用する。
  • 正則化パラメータγのスケーリングにパラメータαを用い、さまざまなデータ条件下でも安定的かつ頑健な表現計算を実現する。
  • 各データ点ごとに、対角成分をゼロとするℓ₁正則化最小二乗法を用いて自己表現問題を解くことで、自己表現を回避する。

実験結果

リサーチクエスチョン

  • RQ1部分空間の和における自己表現を活用することで、正当に正しい外れ値検出手法を設計できるか?
  • RQ2スパース表現グラフの接続構造は、内側の点と外れ値の区別とどのように関係するか?
  • RQ3スパース表現から導かれる有向グラフ上でランダムウォークを用いることで、マルチサブスペースデータにおける外れ値を効果的に検出できるか?
  • RQ4外れ値の割合や幾何的条件が変化する状況下でも、既存の最先端手法と比較して本手法はどのように性能を発揮するか?

主な発見

  • Extended Yale Bデータセット(外れ値15%、内側のグループ3つ)において、比較対象の全手法と比べて最高のAUCおよびF1スコアを達成した。
  • 外れ値の割合が1%から15%に変動する範囲でも、安定した性能を維持しており、汚染度の変動に対して頑健であることが示された。
  • R-graphは、表現の大きさにのみ依存するℓ₁しきい値処理(ℓ₁-thresholding)を著しく上回り、汚染に敏感な手法と比較して優位性を示した。
  • 可視化結果から、極端な照明変化下でも内側の点に対して誤検出(false positives)が少なく、より優れた頑健性を示していることがわかった。
  • スパース表現と効率的なランダムウォークステップのおかげで、REAPER、OutlierPursuit、LRRと比較して収束が早く、計算コストも低い。
  • 理論的分析により、マルコフ連鎖において内側の点が必須状態、外れ値が非必須状態に対応することが確認され、幾何的および接続性の仮定の下で本手法の正当性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。