Skip to main content
QUICK REVIEW

[論文レビュー] On Anomaly Ranking and Excess-Mass Curves

Nicolas Goix, Anne Sabourin|arXiv (Cornell University)|Feb 5, 2015
Anomaly Detection Techniques and Applications参考文献 12被引用数 7
ひとこと要約

本稿は、多次元設定における異常値ランク付けのための新たな性能基準として、質量-体積曲線の関数的代替手段としての過剰質量(EM)曲線を導入する。$n^{-1/2}$ の収束レートを持つ適応的スコア関数推定器を提案し、有界でないサポートに対しても成立する。真の密度と推定密度の間の$L^1$-距離を用いてモデルバイアスを厳密に制御することで、最小限の仮定のもとで普遍的整合性を達成する。

ABSTRACT

Learning how to rank multivariate unlabeled observations depending on their degree of abnormality/novelty is a crucial problem in a wide range of applications. In practice, it generally consists in building a real valued "scoring" function on the feature space so as to quantify to which extent observations should be considered as abnormal. In the 1-d situation, measurements are generally considered as "abnormal" when they are remote from central measures such as the mean or the median. Anomaly detection then relies on tail analysis of the variable of interest. Extensions to the multivariate setting are far from straightforward and it is precisely the main purpose of this paper to introduce a novel and convenient (functional) criterion for measuring the performance of a scoring function regarding the anomaly ranking task, referred to as the Excess-Mass curve (EM curve). In addition, an adaptive algorithm for building a scoring function based on unlabeled data X1 , . . . , Xn with a nearly optimal EM is proposed and is analyzed from a statistical perspective.

研究の動機と目的

  • 教師なし学習における多次元異常値ランク付けのための原理的基準の欠如に応えること。
  • 有界でないサポートを持つ分布に対しても良好に動作する統計的に整合的な、適応的スコア関数推定器を開発すること。
  • 真の密度レベル集合が仮説クラスに含まれない状況においても、モデルバイアスを理論的分析に組み込むことにより、正確な密度レベル集合の一致を必要としないこと。
  • 実験的EM曲線最適化における学習レートの上限を$n^{-1/2}$のオーダーで与えること。これにより、先行研究の$n^{-1/4}$レートを改善すること。

提案手法

  • 体積制約のもとでレベル集合の質量を最大化する関数的基準として、過剰質量(EM)曲線を提案。最小体積集合の目的関数とは逆転する。
  • 最適EM曲線を、与えられた体積のすべての可測集合における過剰質量の上界として定義。密度等高線クラスタと整合する。
  • 有限グリッド上の閾値の離散化最適化により、EM基準に基づくネストされた推定密度レベル集合の系列を構築。
  • 一様収束の議論と濃度不等式を用いて、実験的EM曲線と真のEM曲線の乖離を高確率でバインド。
  • 真の密度$f$と仮説クラス$\mathcal{F}$への射影$f_F$の間の$L^1$-距離を用いてモデルバイアスを組み込み、一様にバイアスをバインド。
  • パrametricな仮定がなければ、データ駆動型の閾値決定戦略(実験的分位数に基づく)を用いて、一貫性と適応性を確保。

実験結果

リサーチクエスチョン

  • RQ1多次元異常値ランク付けのための関数的基準を定義可能か。これは一変量の尾部解析を一般化し、一貫性のある学習を可能にするか。
  • RQ2コンパクトサポートが存在しない状況において、EM曲線が質量-体積曲線と比較してより速い収束レートを提供するか。
  • RQ3真の密度レベル集合が仮説クラスに含まれない場合、異常値ランク付けにおいてモデルバイアスを形式的に定量化・制御することは可能か。
  • RQ4最小限の正則性仮定のもとで、異常値スコア関数に対して$n^{-1/2}$の学習レート収束を達成することは可能か。

主な発見

  • 提案されたEM曲線基準により、最適スコア関数が密度の非減少変換に対して不変となることが保証され、異常値ランク付けの目的と整合する。
  • 実験的EM曲線最適化の収束レートが$n^{-1/2}$に達し、先行研究の質量-体積曲線手法の$n^{-1/4}$レートよりも顕著に速い。
  • 弱い正則性条件のもとで、真の分布が有界でないサポートを持つ場合でも、本手法は一貫性を保ち、$n^{-1/2}$のレートを達成する。
  • モデルバイアスは$\|f - f_F\|_{L^1}$によって一様にバインドされ、モデル不適合に起因する近似誤差の非漸近的制御が可能となる。
  • 濃度不等式とEM曲線の微分特性に依拠して、高確率の一様乖離バインドを用いた理論的保証を確立。
  • アルゴリズムにより、ネストされた推定密度レベル集合の系列が得られ、観測値の異常度スコアによる自然なランク付けが可能となる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。