Skip to main content
QUICK REVIEW

[論文レビュー] Data Augmentation by AutoEncoders for Unsupervised Anomaly Detection

Kasra Babaei, Zhiyuan Chen|arXiv (Cornell University)|Dec 21, 2019
Anomaly Detection Techniques and Applications参考文献 24被引用数 5
ひとこと要約

本稿では、異常検出における教師なし1クラス分類器(OCC)の性能向上を目的として、自己符号化器(AE)を用いた意味のある潜在空間におけるデータ拡張手法を提案する。正常データ上でAEを学習し、その学習済み潜在表現を訓練データに拡張することで、特に高次元・小標本サイズの状況において、SMOTE や ADASYN、ノイズベースの拡張法を上回る性能を示す。複数のベンチマークデータセット上で実験した結果、優れた性能が得られた。

ABSTRACT

This paper proposes an autoencoder (AE) that is used for improving the performance of once-class classifiers for the purpose of detecting anomalies. Traditional one-class classifiers (OCCs) perform poorly under certain conditions such as high-dimensionality and sparsity. Also, the size of the training set plays an important role on the performance of one-class classifiers. Autoencoders have been widely used for obtaining useful latent variables from high-dimensional datasets. In the proposed approach, the AE is capable of deriving meaningful features from high-dimensional datasets while doing data augmentation at the same time. The augmented data is used for training the OCC algorithms. The experimental results show that the proposed approach enhance the performance of OCC algorithms and also outperforms other well-known approaches.

研究の動機と目的

  • 高次元・スパース・小トレーニングセットの状況において、1クラス分類器(OCC)の性能が劣化する問題に対処すること。
  • 自己符号化器が、OCCの一般化性能を向上させる意味のある潜在空間におけるデータ拡張を生成できるかどうかを検証すること。
  • ラベル付き異常データを一切必要とせず、教師なし学習の制約を保ったまま、異常検出性能を向上させること。
  • 多様で現実世界のデータセット(異常タイプやスパarsityが異なる)において、AEが生成する拡張法の有効性を評価すること。

提案手法

  • 正常データのみを用いて深層自己符号化器を学習し、ボトルネック層における圧縮された非線形表現を学習する。
  • 複数の訓練エポックにおける学習済みAEから潜在ベクトルを抽出し、拡張された訓練サンプルを生成する。
  • 拡張された潜在データを用いて、1クラス分類器(例:LOF、Isolation Forest、KDE)を再訓練し、境界学習を改善する。
  • すべてのデータセットに同じAEアーキテクチャを適用することで、公平な比較を確保する。高次元・スパースなデータセット(例:InternetAds(1558特徴量))にも適用可能である。
  • 性能差の有意性を評価するために、統計的検定(Wilcoxon符号順位検定)を実施する。特に、ノイズ追加ベースの拡張法との比較に用いる。
  • 標準指標(ROC AUC および PR AUC)を用いて、複数のベンチマークデータセット(NSL-KDD、CTU13、PenDigits など)で性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1自己符号化器から得られる潜在空間におけるデータ拡張は、教師なし異常検出における1クラス分類器の性能を向上させることができるか?
  • RQ2SMOTE や ADASYN といった従来手法と比較して、AEベースのデータ拡張は、異常検出の AUC スコアにおいてどのように差をつけるか?
  • RQ3特徴量のスパarsityが表現学習を困難にする高次元・スパースデータセットにおいて、本手法は依然として頑健性を保っているか?
  • RQ4ノイズベースの拡張法やベースラインOCCと比較して、性能向上が統計的に有意であるか?

主な発見

  • NSL-KDD および CTU13 データセットにおいて、提案手法のAEベースのデータ拡張は、SMOTE や ADASYN を上回り、ほとんどのケースで最高の PR AUC および ROC AUC を達成した。
  • PenDigits データセットでは、他の拡張手法と比較して、LOFスコアの分散が著しく小さく、より安定的かつ頑健な分類境界を示した。
  • Wilcoxon符号順位検定により、提案手法とノイズベースの拡張法との間でLOFスコアの差が統計的に有意(p < 0.05)であることが確認された。
  • 高次元・スパースな InternetAds データセット(1558特徴量)においても、本手法は依然として競争力のある性能を示したが、他のデータセットに比べて差が小さかった。これは、特徴量のスパarsityに感受性がある可能性を示唆している。
  • NSL-KDD の U2R サブセットでは、ROC AUC で2番目に高いスコアを記録し、わずかにノイズ拡張法に 0.044 AUC ポイント劣った。
  • 単一の異常タイプを持つデータセット(例:PenDigits、Spambase、Arrhythmia)において、AEベースの拡張は、常に最先端の手法を上回るか、同等の性能を示した。特に PR AUC において顕著な優位性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。