Skip to main content
QUICK REVIEW

[論文レビュー] Outlier Detection on Mixed-Type Data: An Energy-based Approach

Kien Do, Truyen Tran|arXiv (Cornell University)|Aug 17, 2016
Anomaly Detection Techniques and Applications参考文献 19被引用数 5
ひとこと要約

本稿では、連続的、二値的、度数的、名義的属性を含む混合型データに対する、未知の外れ値検出手法を提案する。この手法は、拡張された混合変数制限ボルツマンマシン(Mv.RBM)から導出された自由エネルギーを用い、Mv.RBMの効率的な密度推定の利点を活かしている。自由エネルギーは定数項を除いて負の対数密度に等しく、原理的かつ一貫した外れ値スコアとして機能する。実世界のデータセットにおいて、単一型および混合型のベースラインを上回る最先端の性能を達成している。

ABSTRACT

Outlier detection amounts to finding data points that differ significantly from the norm. Classic outlier detection methods are largely designed for single data type such as continuous or discrete. However, real world data is increasingly heterogeneous, where a data point can have both discrete and continuous attributes. Handling mixed-type data in a disciplined way remains a great challenge. In this paper, we propose a new unsupervised outlier detection method for mixed-type data based on Mixed-variate Restricted Boltzmann Machine (Mv.RBM). The Mv.RBM is a principled probabilistic method that models data density. We propose to use \emph{free-energy} derived from Mv.RBM as outlier score to detect outliers as those data points lying in low density regions. The method is fast to learn and compute, is scalable to massive datasets. At the same time, the outlier score is identical to data negative log-density up-to an additive constant. We evaluate the proposed method on synthetic and real-world datasets and demonstrate that (a) a proper handling mixed-types is necessary in outlier detection, and (b) free-energy of Mv.RBM is a powerful and efficient outlier scoring method, which is highly competitive against state-of-the-arts.

研究の動機と目的

  • 連続的、二値的、度数的、名義的変数を含む異種データにおける外れ値検出の課題に対処すること。
  • ヒューリスティックな仮定やデータコーディングを必要とせず、異なるデータタイプ間の相関をモデル化できるスケーラブルで原理的な手法を開発すること。
  • 変換されたデータに対して単一型の手法を用いるのとは対照的に、混合データタイプの適切な取り扱いが、効果的な外れ値検出に不可欠であることを示すこと。
  • 提案手法を最先端のベースラインと比較し、精度および効率の両面で優れていることを示すこと。

提案手法

  • 度数的属性をポアソン分布を用いてモデル化することで、Mv.RBMを拡張し、多様なデータタイプの共同モデル化を可能にした。
  • Mv.RBMの自由エネルギーを外れ値スコアとして用い、これは定数項を除いて負の対数密度に等しくなる。これにより、原理的かつ一貫した密度ベースの外れ値検出が可能となる。
  • 大規模データセットでは適応的学習率(Adam)を用いた確率的勾配降下法によりMv.RBMを訓練し、大規模データセット上での効率的かつスケーラブルな学習を実現した。
  • 自由エネルギーは1回の行列射影によって効率的に計算可能であり、推論が高速でリアルタイム応用に適している。
  • 直接的なタイプ間依存関係のモデリングを避けるために、二値の潜在変数を介して異なるタイプ間の相関を捉えた。
  • 外れ値検出は、自由エネルギー値に基づくインスタンスの順序付けによって実行され、低い値は密度が低く、外れ値の可能性が高いことを示す。

実験結果

リサーチクエスチョン

  • RQ1データタイプの変換やヒューリスティックな距離の組み合わせを必要とせず、統一的かつ確率的モデルが混合型データを効果的に処理できるか?
  • RQ2Mv.RBMの自由エネルギーを外れ値スコアとして用いることで、従来の密度ベースや距離ベースの手法に比べ、より正確かつスケーラブルな代替手段が得られるか?
  • RQ3外れ値検出に効果的であるためには、混合データタイプの適切なモデリングが不可欠であり、変換後の単一型手法で十分なのか?
  • RQ4提案手法は、最先端の混合型外れ値検出技術と比較して、性能およびスケーラビリティの面で優れているか?

主な発見

  • 提案されたMv.RBMベースの手法は、7つの混合型データセットで平均Fスコア0.91を達成し、次に優れた手法(BMM)を平均8.3%上回った。
  • KDD99-10データセットではAUCが0.914に達し、自由エネルギー分布におけるインライヤーとアウ tiersの良好な分離を示した。
  • 最大のデータセットKDD99-10において、最も優れた単一型ベースライン(PPCA)に比べ29.1%の改善を示し、スケーラビリティと有効性の両面で優れた性能を示した。
  • 単一型手法の平均Fスコアは0.66、混合型手法の平均は0.77であった。これは、高性能な外れ値検出には混合タイプの適切な取り扱いが不可欠であることを示している。
  • Mv.RBMモデルは、Auto MPGおよびKDD99-10データセットでFスコア1.00(完璧)を達成し、多様なデータタイプへの強力な一般化能力を示した。
  • 本手法は非常にスケーラブルであり、確率的勾配降下法と行列射影により、学習および推論が効率的に行えるため、大規模データセットへの適用が可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。