Skip to main content
QUICK REVIEW

[論文レビュー] Normality-Calibrated Autoencoder for Unsupervised Anomaly Detection on Data Contamination

Jongmin Yu, Hyeontaek Oh|arXiv (Cornell University)|Oct 28, 2021
Anomaly Detection Techniques and Applications参考文献 28被引用数 14
ひとこと要約

本稿では、低エントロピーな潜在空間から高信頼性の正常サンプルを敵対的に生成し、汚染されたサンプルを同定することで、データ汚染に対する耐性を高める完全に教師なしの異常検出手法であるNormality-Calibrated Autoencoder (NCAE) を提案する。NCAE は最先端の教師なし手法を上回り、MNIST および Fashion-MNIST データセットにおいて、20% までの高い汚染率でも、半教師あり手法と同等の性能を達成する。

ABSTRACT

In this paper, we propose Normality-Calibrated Autoencoder (NCAE), which can boost anomaly detection performance on the contaminated datasets without any prior information or explicit abnormal samples in the training phase. The NCAE adversarially generates high confident normal samples from a latent space having low entropy and leverages them to predict abnormal samples in a training dataset. NCAE is trained to minimise reconstruction errors in uncontaminated samples and maximise reconstruction errors in contaminated samples. The experimental results demonstrate that our method outperforms shallow, hybrid, and deep methods for unsupervised anomaly detection and achieves comparable performance compared with semi-supervised methods using labelled anomaly samples in the training phase. The source code is publicly available on `https://github.com/andreYoo/NCAE_UAD.git'.

研究の動機と目的

  • 未知の異常サンプルが混入した訓練データにおいて、異常検出性能が低下する課題に対処すること。
  • 訓練時に事前知識や明示的な異常サンプルを必要としない完全に教師なしの手法を開発すること。
  • 汚染されたサンプルの再構成誤差を特定し、最大化することで、モデルの汚染に対する耐性を向上させること。
  • 訓練時にラベル付き異常を用いないまま、半教師あり手法と競合する性能を達成できること。
  • 未知または汚染されたサンプルの再構成においてオートエンコーダーの過信問題を、潜在空間における正規性のキャリブレーションによって克服すること。

提案手法

  • 正常サンプルの再構成誤差を最小化し、汚染されたサンプルの再構成誤差を最大化するように、正規性キャリブレート再構成(NCR)損失を用いてオートエンコーダーを訓練する。
  • 生成対抗ネットワーク(GAN)フレームワークを用いて、正常データを中心に集中する知識豊富でエントロピーの低い潜在特徴分布に変換する。
  • 学習済みの潜在分布の中心(低エントロピー領域)からノイズをサンプリングすることで、高信頼性の正常サンプルを生成する。
  • 対照的学習を用いて、入力サンプルと生成された高信頼性の正常サンプルを比較し、汚染度スコアを推定する。
  • 再構成誤差に基づいて汚染されたサンプルを繰り返し特定し、それらのサンプルに対して誤差を増大させるようにオートエンコーダーを再訓練する。
  • 汚染されたサンプルが高汚染率下で低エントロピークラスタを形成する可能性があるため、潜在特徴のエントロピーを用いて汚染を検出する。

実験結果

リサーチクエスチョン

  • RQ1訓練データに未知の異常サンプルが混入した場合でも、完全に教師なしの異常検出モデルが高い性能を維持できるか?
  • RQ2低エントロピーな潜在空間から高信頼性の正常サンプルを敵対的に生成することで、データ汚染に対する耐性が向上するか?
  • RQ3提案手法は、さまざまな汚染率下で既存の教師なし異常検出手法を上回るか?
  • RQ4ラベル付き異常を訓練時に使用しないにもかかわらず、明示的な異常ラベルを用いる半教師あり手法と同等の性能を達成できるか?
  • RQ5高汚染率下で潜在特徴のエントロピーはどのように変化するか? また、その挙動を活用して汚染されたサンプルを検出できるか?

主な発見

  • MNIST において、1% 汚染率では AUC 97.2%、10% 汚染率では 92.6% を達成し、すべての教師なしベースラインを上回る。
  • Fashion-MNIST では、10% 汚染率で AUC 91.5%、20% 汚染率で 88.97% を達成し、リストアップされたすべての教師なし手法を上回る。
  • ラベル付き異常を一切使用しないにもかかわらず、SSAD や Deep SAD といった、訓練時に明示的な異常サンプルを用いる半教師あり手法と同等の性能を達成する。
  • 汚染がないデータ(ρ=0.0)では、モデルの汚染を前提とする内在的仮定のため、わずかに性能が低下するが、全汚染率レベルで強い性能を維持する。
  • 汚染されたサンプルが低エントロピークラスタを形成する場合でも、効果的に汚染を検出でき、従来のエントロピーに基づく手法の失敗モードを是正する。
  • NCAE フレームワークは、複数のデータセットおよび汚染率においても堅牢性を示し、実世界のシナリオにおける一般化能力を裏付ける。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。