[論文レビュー] Self-supervise, Refine, Repeat: Improving Unsupervised Anomaly Detection
本稿では、自己教師あり表現とコンSENSUSに基づくデータ精錬を活用し、アンサンブルによる1クラス分類器(OCC)を用いて訓練データを反復的に改善することで、モデルのロバスト性を高める、完全に教師なしの異常検出のためのデータ中心フレームワークSRR(Self-supervise, Refine, Repeat)を提案する。SRRは、CIFAR-10および甲状腺疾患データセットにおいて、AUCを6.3ポイント、F1スコアを22.9ポイント改善し、状態を凌駕する性能を達成している。これは、異常比が高めであっても同様に有効である。
Anomaly detection (AD), separating anomalies from normal data, has many applications across domains, from security to healthcare. While most previous works were shown to be effective for cases with fully or partially labeled data, that setting is in practice less common due to labeling being particularly tedious for this task. In this paper, we focus on fully unsupervised AD, in which the entire training dataset, containing both normal and anomalous samples, is unlabeled. To tackle this problem effectively, we propose to improve the robustness of one-class classification trained on self-supervised representations using a data refinement process. Our proposed data refinement approach is based on an ensemble of one-class classifiers (OCCs), each of which is trained on a disjoint subset of training data. Representations learned by self-supervised learning on the refined data are iteratively updated as the data refinement improves. We demonstrate our method on various unsupervised AD tasks with image and tabular data. With a 10% anomaly ratio on CIFAR-10 image data / 2.5% anomaly ratio on Thyroid tabular data, the proposed method outperforms the state-of-the-art one-class classifier by 6.3 AUC and 12.5 average precision / 22.9 F1-score.
研究の動機と目的
- 訓練データにラベルのない正常および異常サンプルが混在する完全に教師なしの異常検出の課題に対処すること。
- ラベルデータが一切ない状況下で、自己教師あり表現に基づく1クラス分類器(OCC)のロバスト性を向上させること。
- 複数のOCCによるコンセンサスに基づき、段階的に異常候補を除外するデータ精錬メカニズムを開発すること。
- 真の異常比に関する事前知識がなくても動作可能なフレームワークを実現するため、Otsu法を用いて自動的にしきい値を決定する仕組みを統合すること。
- 画像および表形式データを含む多様なデータセットにおいて、現実的な教師なし設定下で最先端の性能を示すことを目的とする。
提案手法
- フレームワークは、ラベルなしの訓練データの不重複部分集合にそれぞれ訓練されたOCCのアンサンブルを採用し、潜在的な異常を検出する。
- すべてのOCCが一致して正常と分類されたサンプルのみが正常とみなされ、これによりコンセンサスに基づくデータ精錬が可能になり、異常候補が除外される。
- 精錬済みデータから自己教師あり表現を学習し、複数の精錬サイクルにわたり反復的に更新する。
- 最終的な異常検出モデルは、精錬済みデータを用いて自己教師ありコントラスト学習により訓練され、表現品質が向上する。
- 真の異常比が不明な場合、正規性スコア分布に基づき、ハイパーパramータγのしきい値を自動的に決定するためにOtsu法を用いる。
- フレームワークは柔軟性に富み、任意のOCCと、生データまたは学習済み表現の両方へ適用可能である。
実験結果
リサーチクエスチョン
- RQ1アンサンブルOCCを用いた反復的データ精錬は、完全に教師なしの異常検出における1クラス分類器のロバスト性を向上させ得るか?
- RQ2ラベルなしデータに異常サンプルが混在する状況で、最先端のOCCの性能はどの程度劣化し、その劣化は緩和可能か?
- RQ3自己教師あり表現を反復的データ精錬と組み合わせることで、異常検出性能はどの程度向上するか?
- RQ4Otsu法は、真の異常比を事前に知らなくてもSRRフレームワークにおける自動しきい値選択に有効に機能するか?
- RQ5SRRは、異常比が変動するさまざまなデータセット(画像および表形式データ)において、どの程度の性能を発揮するか?
主な発見
- 10%の異常比を有するCIFAR-10では、SRRはSOTAのOCCに対してAUCを6.3ポイント、平均適合率(average precision)を12.5ポイント改善した。
- 2.5%の異常比を有する甲状腺疾患データセットでは、SRRはSOTAのOCCに対してF1スコアで22.9ポイントの改善を達成した。
- SRRは高い異常比に対しても強固な性能を維持しており、従来のOCCが著しく性能を低下させる状況でも優れたロバスト性を示した。
- 真の異常比が不明な状況でOtsu法を用いて自動的にしきい値を決定した場合でも、SRRはCIFAR-10でSOTAのOCCを5.1 AUCポイント、甲状腺疾患データセットで11.7 F1ポイント上回った。
- 真の異常比が分かっている場合と比較して、Otsu法の統合による性能低下はわずかであり、実世界のシナリオにおいても有効性が確認された。
- 広範なアブレーションスタディにより、アンサンブルベースの精錬と反復的自己教師あり学習の両方が、性能向上に不可欠であることが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。