Skip to main content
QUICK REVIEW

[論文レビュー] Robust Variational Autoencoder for Tabular Data with Beta Divergence

Haleh Akrami, Sergül Aydöre|arXiv (Cornell University)|Jun 15, 2020
Anomaly Detection Techniques and Applications参考文献 17被引用数 5
ひとこと要約

本稿では、混合カテゴリカルおよび連続的テーブルデータにおける外れ値に対する訓練のロバスト性を向上させるためにβ-損失を用いる、テーブルデータ向けのロバストな変分オートエンコーダー(RTVAE)を提案する。標準のKL損失に代えて再構成損失にβ-損失を導入することで、訓練データに最大1%の汚染が含まれても、KDDCup 99、NSL-KDD、UNSW-NB15 データセットにおいて、標準VAEを上回るAUC性能を維持する。

ABSTRACT

We propose a robust variational autoencoder with $β$ divergence for tabular data (RTVAE) with mixed categorical and continuous features. Variational autoencoders (VAE) and their variations are popular frameworks for anomaly detection problems. The primary assumption is that we can learn representations for normal patterns via VAEs and any deviation from that can indicate anomalies. However, the training data itself can contain outliers. The source of outliers in training data include the data collection process itself (random noise) or a malicious attacker (data poisoning) who may target to degrade the performance of the machine learning model. In either case, these outliers can disproportionately affect the training process of VAEs and may lead to wrong conclusions about what the normal behavior is. In this work, we derive a novel form of a variational autoencoder for tabular data sets with categorical and continuous features that is robust to outliers in training data. Our results on the anomaly detection application for network traffic datasets demonstrate the effectiveness of our approach.

研究の動機と目的

  • 訓練データに外れ値が含まれる場合に、標準的な変分オートエンコーダー(VAE)の正常行動の学習された表現が歪みやすいという脆弱性に対処すること。
  • 画像データに既に適用済みのロバストなβ-損失フレームワークを、カテゴリカルおよび連続的特徴を併せ持つテーブルデータに拡張すること。
  • カテゴリカルおよび連続的変数の両方を扱える統一的な訓練メカニズムをRTVAEに開発し、β-損失に基づく再構成損失を用いること。
  • 特にラベル付き異常データが少ないネットワークトラフィックデータセットにおいて、データ汚染下での異常検知のロバスト性を向上させること。

提案手法

  • 外れ値による大きな再構成誤差への感受性を低減するため、VAEの再構成損失における標準的なKL損失をβ-損失に置き換える。
  • 離散確率分布を考慮したβ-交差エントロピーの定式化を用いて、カテゴリカル変数のβ-損失に基づく再構成損失を導出する。
  • ガウス分布を仮定した連続的変数の再構成損失を、修正された対数尤度項を介してβ-損失に適合させる。
  • カテゴリカルおよび連続的再構成損失を統合し、混合テーブルデータ向けの単一の目的関数を構築することで、エンドツーエンドの訓練を可能にする。
  • 連続的デコーダーにはtanh活性化関数、カテゴリカルデコーダーにはソフトマックス活性化関数を用いた全結合ニューラルネットワークアーキテクチャを採用する。
  • バリデーションAUCを用いてβハイパーパrameterを調整し、過学習を防ぐために早期停止を適用する。

実験結果

リサーチクエスチョン

  • RQ1β-損失は、カテゴリカルおよび連続的特徴を併せ持つテーブルデータにおいて、外れ値を含む訓練データ下でもVAEのロバスト性を向上させることができるか?
  • RQ2ネットワークトラフィックデータセットにおいて、データ汚染度が上昇する条件下で、RTVAEの性能は標準VAEと比べてどのように異なるか?
  • RQ3真の正常分布が外れ値によって汚染された状況下でも、提案されたβ-損失に基づく再構成損失は高い異常検知精度を維持できるか?
  • RQ4訓練データに悪意のあるデータやノイズが含まれる場合でも、RTVAEは正常行動の意味のある低次元表現を効果的に学習できるか?

主な発見

  • 標準VAEのAUC性能は、訓練データにたった1%の汚染が含まれるだけで著しく低下し、外れ値に対して極めて感受性が高いことが示された。
  • RTVAEは、KDDCup 99、NSL-KDD、UNSW-NB15 というすべてのテストデータセットにおいて、1%の訓練汚染下でも安定的かつ高いAUC性能を維持した。
  • モデルのロバスト性は、β-損失が訓練中に外れ値からの大きな再構成誤差の影響を低減できる能力に起因する。
  • バリデーションAUCを用いてβハイパーパラメータを[1e-5, 0.1]の範囲でチューニングした結果、低β値で最良の性能が得られた。
  • RTVAEは、データポイズニングやノイズの多いデータ収集環境下でも、標準VAEよりも優れた異常検知性能を示した。
  • 本手法により、画像ベースのVAEに用いられていたβ-損失が、カテゴリカルおよび連続的特徴を併せ持つテーブルデータへと効果的に一般化され、ロバストな表現学習が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。