Skip to main content
QUICK REVIEW

[論文レビュー] Self-Trained One-class Classification for Unsupervised Anomaly Detection.

Jinsung Yoon, Kihyuk Sohn|arXiv (Cornell University)|Jun 11, 2021
Anomaly Detection Techniques and Applications参考文献 49被引用数 9
ひとこと要約

本稿では、自己訓練によるワンクラス分類フレームワークであるSTOCを提案する。この手法は、不均衡なラベルなしの異常検出を目的とし、データの部分集合に別々に訓練されたアンサンブルワンクラス分類器を用いて、反復的にデータとディープ表現を精錬する。本手法は最先端の性能を達成し、CIFAR-10で異常比10%の条件下で、先行手法よりAUCで6.3ポイント、平均適合率で12.5ポイント優れている。

ABSTRACT

Anomaly detection (AD), separating anomalies from normal data, has various applications across domains, from manufacturing to healthcare. While most previous works have shown to be effective for cases with fully or partially labeled data, they are less practical for AD applications due to tedious data labeling processes. In this work, we focus on unsupervised AD problems whose entire training data are unlabeled and may contain both normal and anomalous samples. To tackle this problem, we build a robust one-class classification framework via data refinement. To refine the data accurately, we propose an ensemble of one-class classifiers, each of which is trained on a disjoint subset of training data. Moreover, we propose a self-training of deep representation one-class classifiers (STOC) that iteratively refines the data and deep representations. In experiments, we show the efficacy of our method for unsupervised anomaly detection on benchmarks from image and tabular data domains. For example, with a 10% anomaly ratio on CIFAR-10 data, the proposed method outperforms state-of-the-art one-class classification method by 6.3 AUC and 12.5 average precision.

研究の動機と目的

  • すべての訓練データがラベルなしで、正常および異常サンプルが混在しているという教師なし異常検出の課題に対処すること。
  • 高価で面倒なデータラベリングに依存を減らし、ラベルなしの異常検出を可能にすること。
  • 反復的なデータおよび表現精錬を通じて一般化性能を向上させる、頑健なワンクラス分類フレームワークの開発。
  • 現実的な教師なし設定下で、画像および表形式データの両分野において、ベンチマークデータセットでの性能向上。

提案手法

  • ラベルなし訓練データの互いに重複しない部分集合に別々に訓練されたワンクラス分類器のアンサンブルを構築し、耐性および多様性を向上させる。
  • アンサンブル予測に基づき、高い信頼度の異常サンプルをフィルタリングすることで、反復的に訓練データを精錬する自己訓練メカニズムを実装する。
  • 正例と異常パターンの間の特徴の識別能を高めるために、コントラスト学習目的関数を用いてディープ表現を更新する。
  • ラベルの必要なしに、分類器性能を段階的に向上させるために、データ精錬と表現学習のステップを交互に実行する。
  • 各自己訓練イテレーションにおいて、信頼度しきい値戦略を用いて潜在的な異常を訓練セットから同定および削除する。
  • アンサンブル全体の予測の一貫性を活用して、データ精錬および表現学習の信頼性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1別々のデータサブセットに訓練されたワンクラス分類器のアンサンブルは、教師なし異常検出における耐性を向上させることができるか?
  • RQ2反復的自己訓練は、ワンクラス分類のためのデータおよびディープ表現の精錬にどの程度効果的か?
  • RQ3提案されたSTOCフレームワークは、画像および表形式ベンチマークで最先端のワンクラス分類手法をどの程度上回るか?
  • RQ4CIFAR-10で10%の異常比のような高い異常比条件下でも、本手法はどの程度の性能を示すか?

主な発見

  • 提案されたSTOC手法は、CIFAR-10で異常比10%の条件下で、最先端のワンクラス分類手法よりもAUCで6.3ポイント向上した。
  • 同じCIFAR-10ベンチマークにおいて、平均適合率が12.5ポイント向上し、適合率に敏感な状況でも優れた性能を示した。
  • アンサンブルベースのデータ精錬戦略は、ラベルなしデータからのノイズを効果的に低減し、モデルの一般化性能を向上させた。
  • 反復的自己訓練プロセスは、表現品質および異常検出性能の両面で一貫した向上をもたらした。
  • 本手法はドメインに跨る一般化性能が高く、画像および表形式データベンチマークの両方で強い結果を示した。
  • 訓練データに顕著な割合の異常が含まれても、本フレームワークは高い性能を維持しており、汚染に強く、頑健であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。