Skip to main content
QUICK REVIEW

[論文レビュー] Learning Representations for Outlier Detection on a Budget

Barbora Micenková, Brian McWilliams|arXiv (Cornell University)|Jul 29, 2015
Anomaly Detection Techniques and Applications参考文献 34被引用数 20
ひとこと要約

本稿では、不正検出性能を向上させるために、非教師あり outlier scoring functions (OSFs) を入力特徴として活用する、新たな教師あり異常検出フレームワーク BORE(Bagged Outlier Representation Ensemble)を提案する。多様な OSFs を統合して豊かな表現を構築し、予算に配慮した特徴選択を適用することで、予測時の計算制約を尊重しつつ、12個の実世界データセットで最先端の AUC 性能を達成する。

ABSTRACT

The problem of detecting a small number of outliers in a large dataset is an important task in many fields from fraud detection to high-energy physics. Two approaches have emerged to tackle this problem: unsupervised and supervised. Supervised approaches require a sufficient amount of labeled data and are challenged by novel types of outliers and inherent class imbalance, whereas unsupervised methods do not take advantage of available labeled training examples and often exhibit poorer predictive performance. We propose BORE (a Bagged Outlier Representation Ensemble) which uses unsupervised outlier scoring functions (OSFs) as features in a supervised learning framework. BORE is able to adapt to arbitrary OSF feature representations, to the imbalance in labeled data as well as to prediction-time constraints on computational cost. We demonstrate the good performance of BORE compared to a variety of competing methods in the non-budgeted and the budgeted outlier detection problem on 12 real-world datasets.

研究の動機と目的

  • ラベル付きデータが乏しいため、クラス不均衡や未知の異常タイプに対処できない純粋な教師あり異常検出の限界を克服する。
  • 表現学習フレームワークを通じてラベル付きデータを活用することで、非教師あり手法の予測性能を向上させる。
  • 複雑なハイパーパramータチューニングを必要とせず、多様な非教師あり OSFs を教師あり学習パイプラインに統合できるスケーラブルで汎用性の高い手法を開発する。
  • テスト時の計算リソース制約下でも効率的な予測を可能にするために、予算に配慮した特徴選択戦略を導入する。
  • 多くの非教師ありアンサンブルとは異なり、最終出力を異常度の確率として解釈可能な統一的で解釈可能なフレームワークを提供する。

提案手法

  • 各データポイントを複数の非教師あり outlier scoring functions (OSFs) を用いて変換し、その出力を非線形特徴表現として扱う。
  • サブサンプリングを用いてクラス不均衡を緩和しながら、ラベル付きインライナー/アウトライアーのデータを用いて、OSF特徴の組み合わせをもとに教師あり分類器(特にバギングアンサンブル)を学習する。
  • バギングとスタビリティ選択を適用することで、極めて不均衡なデータセットにおいてもロバスト性を高め、一般化性能を向上させ、分散を低減する。
  • 正規直交マッチングプロキューラ(OMP)を用いた予算に配慮した特徴選択手順を導入し、ユーザーが定めた計算予算内で予測性能を最大化する OSFs のサブセットを選択する。
  • 各 OSF の計算コストの違いを考慮した特徴選択を実施することで、リアルタイムまたは組み込みシステムにおける効率的な推論を可能にする。
  • 最終分類器の出力を、異常度のキャリブレーション済み確率推定値として用い、解釈可能性と実用的導入を実現する。

実験結果

リサーチクエスチョン

  • RQ1非教師あり OSFs を教師あり表現学習フレームワークに統合することで、単独の非教師ありまたは教師あり手法と比較して、異常検出性能が著しく向上するか?
  • RQ2BORE フレームワークは、ラベル付きアウトライアーが極めて稀な場合に、クラス不均衡をどのように処理するか?
  • RQ3予算に配慮した特徴選択は、検出性能を損なうことなく、予測時の計算コストをどの程度削減できるか?
  • RQ4本手法は、異なるデータ分布や異常特性を示す多様な実世界データセットに一般化可能か?
  • RQ5BORE フレームワークは、再訓練を必要とせずに、新しい OSFs やドメイン固有の知識を統合可能か?

主な発見

  • BORE は 12 個の実世界データセットにおいて、AUC および AUC@0.1 の両面で非教師ありおよび教師ありベースラインを上回り、特に不均衡な設定で優れた性能を示す。
  • 12 個のデータセットのうち 9 個で、BORE-Budget は任意の計算予算に対して、他の手法よりも高い AUC および AUC@0.1 を達成し、優れた効率-性能トレードオフを示している。
  • 予算に配慮した特徴選択戦略(BORE-Budget)は、予算が低下するに従って滑らかに性能低下を示し、コストを考慮しない OMP やランダム選択よりも優れた性能を発揮した。
  • BORE の性能は、より多くの多様な OSFs を用いることで向上し、計算制約が緩和された場合の表現の豊かさの恩恵を裏付けた。
  • BORE-Budget は、きびしい予算制約下でも高い性能を維持しており、少数の情報量の多い OSFs の選択が、高い検出精度を保持できることを示している。
  • バギングとスタビリティ選択によって生じる不安定性に対しても、BORE は頑健であることが実証されており、予算が増加するに従い AUC が単調に向上する傾向を示しており、一部のフラクチュエーションにもかかわらず、性能が向上している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。