Skip to main content
QUICK REVIEW

[論文レビュー] AnoShift: A Distribution Shift Benchmark for Unsupervised Anomaly Detection

Marius Drăgoi, Elena Burceanu|arXiv (Cornell University)|Jun 30, 2022
Network Security and Intrusion Detection被引用数 15
ひとこと要約

AnoShiftは、京都市2006+ネットワークトラフィックデータセットを用いて、10年間にわたり顕著な分布シフトを示す、時系列構造をもつ教師なし異常検出のベンチマークを提案する。フレームワークは、訓練データからの時間的距離に基づき、IID、NEAR、FARの3つのテスト分割を評価し、分布シフトの認識と単純な distillation 技術の適用により、標準的なIID訓練に比べて性能が最大3%向上することを示している。

ABSTRACT

Analyzing the distribution shift of data is a growing research direction in nowadays Machine Learning (ML), leading to emerging new benchmarks that focus on providing a suitable scenario for studying the generalization properties of ML models. The existing benchmarks are focused on supervised learning, and to the best of our knowledge, there is none for unsupervised learning. Therefore, we introduce an unsupervised anomaly detection benchmark with data that shifts over time, built over Kyoto-2006+, a traffic dataset for network intrusion detection. This type of data meets the premise of shifting the input distribution: it covers a large time span ($10$ years), with naturally occurring changes over time (eg users modifying their behavior patterns, and software updates). We first highlight the non-stationary nature of the data, using a basic per-feature analysis, t-SNE, and an Optimal Transport approach for measuring the overall distribution distances between years. Next, we propose AnoShift, a protocol splitting the data in IID, NEAR, and FAR testing splits. We validate the performance degradation over time with diverse models, ranging from classical approaches to deep learning. Finally, we show that by acknowledging the distribution shift problem and properly addressing it, the performance can be improved compared to the classical training which assumes independent and identically distributed data (on average, by up to $3\%$ for our approach). Dataset and code are available at https://github.com/bit-ml/AnoShift/.

研究の動機と目的

  • リアルタイムストリーミングデータにおける分布シフト下での教師なし異常検出のためのベンチマークが不足しているという問題に対処すること。
  • 京都市2006+データセットが、ユーザー行動の変化やシステムの進化に伴い、10年間にわたり自然で段階的な分布シフトを示していることを実証すること。
  • 訓練データからの時間的距離に基づき、IID、NEAR、FARの3つのテスト分割を含む、時系列に基づく評価プロトコルを提案すること。
  • 分布シフトの認識が、実世界の展開環境におけるモデルの汎化性能と耐性向上に寄与することを検証すること。
  • 再現可能な研究を促進するため、公開可能なデータセットとコードベースを提供すること。

提案手法

  • 著者らは、各特徴量の分布分析、t-SNE可視化、最適輸送を用いて、京都市2006+データセットの分布シフトを定量化する。
  • 3分割プロトコルを提案:訓練は2006–2010年(4年)、NEARは2011–2013年(3年)、FARは2014–2015年(2年)として、訓練データからの時間的近接性に基づく。
  • 連続的特徴量は指数的ビニング(233ビン)を用いて離散化し、パcentage特徴量は100値にスケーリングすることで、元のインライヤー/アウトライヤー比を保持する。
  • IDS_detection、Malware_detection、Ashula_detectionといった追加特徴量は、異常信号の表現を維持するために保持する。
  • 標準的なIID訓練に比べ、基本的な知識 distillation 技術を適用することで、分布シフト下でのモデルの汎化性能を向上させる。
  • ベンチマークは、GitHubおよびBitdefenderの共有リポジトリに、コード、事前処理済みデータ分割(300k訓練、各分割30kホールドアウト)、および完全なデータセットバージョンを公開している。

実験結果

リサーチクエスチョン

  • RQ1京都市2006+データセットは、10年間の収集期間中に測定可能な分布シフトを示しているか?
  • RQ2時間的距離が遠くなるに従い(IID 対 NEAR 対 FAR)、モデルのパフォーマンスがどのように低下するか?
  • RQ3分布シフトの認識が、標準的なIID訓練仮定に比べて、異常検出性能の向上に寄与するか?
  • RQ4単純な distillation 技術が、時間的分布シフトに起因するパフォーマンス低下をどの程度緩和できるか?
  • RQ5時系列に基づく評価プロトコルは、標準的なIID評価に比べ、実世界のモデルの汎化をよりよく反映できるか?

主な発見

  • 京都市2006+データセットは、10年間にわたり顕著な非ステーションリティを示しており、各特徴量の分布シフト、t-SNE可視化、最適輸送に基づく距離測定によって裏付けられている。
  • 異常検出モデルは、時間的距離が遠いデータ(FAR)でテストされるほど一貫した性能低下を示しており、特に2014–2015年のFAR分割で最大の低下が観察された。
  • 提案された時系列ベースのベンチマーク(IID、NEAR、FAR)は、時間的パフォーマンス低下を効果的に捉えており、標準的なIID分割に比べてより現実的な評価プロトコルを提供している。
  • 分布シフトの認識と基本的な知識 distillation 技術の適用により、古典的なIID訓練に比べて平均で最大3%のパフォーマンス向上が達成された。
  • ベンチマークは、時間とともに変化するデータ環境下での実世界展開において、シフト認識訓練がより高い耐性と汎化性能をもたらすことを示している。
  • 事前処理済みデータセットとコードは、https://github.com/bit-ml/AnoShift/ で公開されており、再現可能な研究および今後のベンチマーク作成を可能としている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。