Skip to main content
QUICK REVIEW

[論文レビュー] Autoencoders and Generative Adversarial Networks for Anomaly Detection for Sequences.

Stephanie Ger, Diego Klabjan|arXiv (Cornell University)|Jan 8, 2019
Anomaly Detection Techniques and Applications参考文献 17被引用数 9
ひとこと要約

本稿では、自己符号化器と生成対抗ネットワーク(GAN)を用いて、異常検出のための構造を保つ合成時系列データを生成する手法を提案する。自己符号化器とGANを用いて少数クラス(異常)に合成オーバーサンプリングを適用し、GANを用いて多数クラスの分布をモデル化することで、複数の時系列データセットにおける下流分類性能が顕著に向上する。

ABSTRACT

We introduce synthetic oversampling in anomaly detection for multi-feature sequence datasets based on autoencoders and generative adversarial networks. The first approach considers the use of an autoencoder in conjunction with standard oversampling methods to generate synthetic data that captures the sequential nature of the data. A different model uses generative adversarial networks to generate structure preserving synthetic data for the minority class. We also use generative adversarial networks on the majority class as an outlier detection method for novelty detection. We show that the use of generative adversarial network based synthetic data improves classification model performance on a variety of sequence data sets.

研究の動機と目的

  • 少数クラスの時系列異常検出におけるクラス不均衡問題を、合成少数クラス時系列の生成によって解決すること。
  • 合成時系列生成において時系列的および構造的関係を保持することで、モデルの一般化性能を向上させること。
  • 少数クラスおよび多数クラスの両方の時系列をGANベースで生成することで、異常検出性能を向上させること。
  • GANおよび自己符号化器ベースの合成データが、時系列ベースの異常検出における分類性能に与える影響を評価すること。
  • 時系列の整合性を保ちつつ、スケーラブルな生成的手法によるデータ拡張を提供すること。

提案手法

  • 全時系列データに対して自己符号化器を訓練し、入力時系列の圧縮され意味的な表現を学習する。
  • 訓練済み自己符号化器の潜在空間に対して、標準的なオーバーサンプリング手法を適用し、合成少数クラス時系列を生成する。
  • 条件付きGANを訓練し、元のデータの構造的および順序的特性を保つ合成時系列を生成する。
  • GANを用いて少数クラスの合成データを生成し、生成された時系列が意味的および時系列的に整合的であることを保証する。
  • 多数クラスに対して別個のGANを訓練し、その分布を学習することで、学習済み分布から著しく逸脱するサンプルを識別するノベルティ検出を可能にする。
  • 両手法から得られた合成時系列を用いて訓練データセットを拡張し、下流分類モデルの性能を向上させる。

実験結果

リサーチクエスチョン

  • RQ1自己符号化器ベースの潜在空間オーバーサンプリングは、不均衡な時系列データセットにおける異常検出性能を向上させることができるか?
  • RQ2GANで生成された合成時系列は、実データの構造的および順序的特性をどの程度保持しているか?
  • RQ3多数クラスをGANでモデル化することで、ノベルティ検出能力が向上するか?
  • RQ4GANベースの合成データ拡張は、時系列異常検出における従来のオーバーサンプリング手法と比較して優れているか?
  • RQ5生成モデルは、少数異常クラスにおけるデータ不足を効果的に解決できるか、かつ時系列の整合性を維持できるか?

主な発見

  • GANベースの合成データ生成を用いることで、複数の時系列データセットにおける分類モデルの性能が顕著に向上する。
  • GANで生成された合成時系列は、実データの構造的および順序的特性を保持しており、より良い一般化を可能にする。
  • 自己符号化器ベースの潜在空間におけるオーバーサンプリングは、ベースライン手法と比較して異常時系列の検出性能が向上する。
  • 多数クラスをGANでモデル化することで、分布外のサンプルを識別する能力が向上し、効果的なノベルティ検出が可能になる。
  • 自己符号化器とGANベースのデータ拡張を組み合わせることで、従来のオーバーサンプリング手法に比べて、時系列異常検出タスクで優れた性能を達成する。
  • 提案手法は、多様な時系列データセットにおいて一貫した向上を示しており、堅牢性およびスケーラビリティを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。