[論文レビュー] Latent Outlier Exposure for Anomaly Detection with Contaminated Data
本論文は、ラベルなし異常値が混入したデータセット上で深層異常検出器を訓練するための新規手法であるLatent Outlier Exposure (LOE) を提案する。正常データと異常データの両方の損失関数を連携させ、モデルパラメータと潜在的バイナリラベル(正常/異常)を交互に最適化することで、画像、表形式、動画の異常検出ベンチマークにおいて、高汚染比下でも、盲目的な訓練やデータ精錬ベースラインを著しく上回る最先端の性能を達成する。
Anomaly detection aims at identifying data points that show systematic deviations from the majority of data in an unlabeled dataset. A common assumption is that clean training data (free of anomalies) is available, which is often violated in practice. We propose a strategy for training an anomaly detector in the presence of unlabeled anomalies that is compatible with a broad class of models. The idea is to jointly infer binary labels to each datum (normal vs. anomalous) while updating the model parameters. Inspired by outlier exposure (Hendrycks et al., 2018) that considers synthetically created, labeled anomalies, we thereby use a combination of two losses that share parameters: one for the normal and one for the anomalous data. We then iteratively proceed with block coordinate updates on the parameters and the most likely (latent) labels. Our experiments with several backbone models on three image datasets, 30 tabular data sets, and a video anomaly detection benchmark showed consistent and significant improvements over the baselines.
研究の動機と目的
- 異常検出において一般的だがしばしば破れやすい仮定、すなわち訓練データに異常値が含まれないという仮定に対処する。
- 実世界で頻発する、ラベルなし異常値を含む訓練データにおいて、異常検出性能を向上させること。
- さまざまな深層学習バックボーンや損失関数と互換性を持つ、ドメインに依存しない手法を開発すること。
- 異常の位置に関する事前知識が不要な、エンドツーエンドの訓練を可能にし、同時に異常を同定し、頑健な表現を学習すること。
- 画像、表形式データ、動画シーケンスを含む多様なデータタイプにおいて、盲目的な訓練や反復的データ精錬といった既存手法を上回ること。
提案手法
- 各データポイントについて、連続的なモデルパラメータと離散的な潜在ラベル(正常対異常)の両方を最適化する共同最適化フレームワークを導入する。
- 正常データ用と異常データ用の2つの結合損失関数を用い、両者とも同じモデルパラメータを共有する。
- ブロック座標降下法を用いて、繰り返しモデルパラメータと最も可能性の高い潜在ラベルを更新する。
- 自己教師あり学習や対照的学習の損失関数を、NTL、ResNet、オートエンコーダーなどのモデルと組み合わせて、異常スコアリングのコアメカニズムとして活用する。
- 推論時には、2つの損失関数のうち片方のみをしきい値処理することで、定数時間の予測が可能になる。
- さまざまなバックボーンアーキテクチャと損失関数と統合することで、画像、表形式、動画データへの柔軟な適用を可能にする。
実験結果
リサーチクエスチョン
- RQ1訓練中に潜在的異常ラベルを推定する共同最適化フレームワークは、汚染されたデータセットにおける異常検出性能を向上させることができるか?
- RQ2訓練データにおける真の異常比に関する誤った仮定に対し、提案手法はどれほど頑健か?
- RQ3汚染が存在する状況下で、盲目的な訓練やデータ精錬といった既存ベースラインを上回るか?
- RQ4本手法は、画像、表形式データ、動画シーケンスを含むさまざまなデータモダリティに一般化可能か?
- RQ5異なる損失関数やバックボーンモデルが、本手法の性能に与える影響は何か?
主な発見
- LOEは、CIFAR-10、30の表形式データセット、UCSD Pedestrian動画ベンチマークを含む、すべての評価済みデータセットで盲目的な訓練やデータ精錬ベースラインを著しく上回る。
- UCSD Pedestrian動画データセットでは、10%および20%の汚染比下で、それぞれDeep Ordinal RegressionよりもAUCが18.8%および9.2%高い。
- LOE H は高い頑健性を示す:ハイパーパrameter α(仮定された異常比)が真の比から5%ずれても、性能低下は最大1.4%にとどまる。
- LOE S は、仮定された異常比 α が真の汚染比よりも大きい場合に、特に盲目的な訓練やデータ精錬ベースラインを上回る。
- 本手法は、評価したすべてのベンチマークで最先端の性能を達成しており、画像、表形式、動画の異常検出タスクに共通して有効である。
- 本手法は高汚染レベル下でも効果的であり、異常位置の事前知識や明示的なデータクリーニングが不要な状況でも一貫した改善効果を示す。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。