Skip to main content
QUICK REVIEW

[論文レビュー] A Survey of Visual Sensory Anomaly Detection

Xi Jiang, Guoyang Xie|arXiv (Cornell University)|Feb 14, 2022
Anomaly Detection Techniques and Applications被引用数 8
ひとこと要約

本サーベイは、形と教師ありレベルに基づき、物体レベル、シーンレベル、イベントレベルの異常に分類することで、視覚的感覚異常検出(AD)の最初の包括的レビューを提供する。深層学習手法の統合、主な課題の特定、産業用ADにおける事前学習モデル、継続的学習、3次元AD、意味的注意をもつシーン生成といったオープンな方向性の提案を行う。

ABSTRACT

Visual sensory anomaly detection (AD) is an essential problem in computer vision, which is gaining momentum recently thanks to the development of AI for good. Compared with semantic anomaly detection which detects anomaly at the label level (semantic shift), visual sensory AD detects the abnormal part of the sample (covariate shift). However, no thorough review has been provided to summarize this area for the computer vision community. In this survey, we are the first one to provide a comprehensive review of visual sensory AD and category into three levels according to the form of anomalies. Furthermore, we classify each kind of anomaly according to the level of supervision. Finally, we summarize the challenges and provide open directions for this community. All resources are available at https://github.com/M-3LAB/awesome-visual-sensory-anomaly-detection.

研究の動機と目的

  • コンピュータビジョン分野における視覚的感覚異常検出(AD)の包括的レビューの欠如、特に意味的シフトではなく共変量シフトに焦点を当てた問題を解決すること。
  • 異常形式に基づき、視覚的感覚ADを物体レベル、シーンレベル、イベントレベルの3段階に体系的に分類すること。
  • 教師ありレベル(教師なし、弱教師あり、教師あり)に基づき、既存の手法を分類すること。
  • 視覚的感覚ADの実世界応用における進展を促すために、未解決の課題を特定し、今後の研究方向性を提案すること。

提案手法

  • 本サーベイは、視覚的感覚ADを3つの階層的形態に分類する:物体レベル(局所的欠険)、シーンレベル(シーン内に新しい物体)、イベントレベル(動画内の異常行動)。
  • 学習パラダイムに基づき、手法を分類する:教師なし(自己教師あり、事前学習適応、再構成、特徴モデリング)、弱教師あり(不完全/半教師あり、不正確な教師あり)、教師あり(具体的な構造的または素材的欠陥)。
  • 動画レベルのADについては、さらに教師ありレベルに基づきグループ化する:教師なし(例:GANベース、オートエンコーダベース、動き特徴融合)、弱教師あり(例:関係に注意を向けるCNN、自己注意CRF、時系列特徴学習)、教師あり(例:手作業特徴、オンライン学習、動き損失)。
  • MVTec AD、ShanghaiTech、Lost and Foundなどの既存ベンチマークを活用して、手法の性能とドメイン間の一貫性を評価する。
  • 分布外検出や1クラス分類といった関連分野からの知見を統合し、意味的シフトと感覚的(共変量)シフトの違いを明確にする。
  • 著者らは、再現可能性とコミュニティの成長を支援するため、https://github.com/M-3LAB/awesome-visual-sensory-anomaly-detection に包括的なリソースリポジトリを構築した。

実験結果

リサーチクエスチョン

  • RQ1異常形式(物体、シーン、イベント)と教師ありレベルに基づき、視覚的感覚異常検出を体系的に分類する方法は何か?
  • RQ2教師なし、弱教師あり、教師ありアプローチの間で、視覚的感覚ADにおける主な手法的差異は何か?
  • RQ3最近の深層学習手法は、ドメインシフト、限られた異常データ、未学習ドメインへの一般化といった課題をどのように扱っているか?
  • RQ4産業的および3次元環境における視覚的感覚異常検出における未解決の課題と今後の研究方向性は何か?
  • RQ5自己教師ありおよび事前学習モデルは、低データ、実世界の異常検出シナリオにおいて、どのようにして性能を向上させることができるか?

主な発見

  • 本サーベイは、視覚的感覚ADが共変量シフト(局所的視覚的逸脱)に焦点を当てているのに対し、意味的AD(ラベルレベルのシフト)とは異なり、かつ過去のサーベイで過小評価されてきたことを特定した。
  • 教師なし手法が物体レベルADを支配しており、再構成ベースや自己教師あり技術(例:Li et al., 2021; Sheynin et al., 2021)がMVTec ADで優れた性能を示している。
  • 弱教師あり動画AD手法、例えば関係に注意を向けるCNN(Purwanto et al., 2021)や二重パスリファインメント(Wu et al., 2021)を用いる手法は、粗いアノテーションのみで良好な局所化性能を達成している。
  • 教師あり動画ADモデル、例えば動き損失(Li et al., 2022)やオンライン学習(Lu et al., 2018)を用いるモデルは、ShanghaiTechのようなベンチマークで高い推論速度(1,000–1,200 fps)と高い精度を達成している。
  • 本サーベイは、現在の事前学習モデル(例:ImageNetで学習されたResNet18)が産業用ADにおいてドメインバイアスを引き起こしていることを強調し、異常データに基づくドメイン特化の事前学習が有望な今後の方向性であると指摘した。
  • 3次元ADは高潜力分野として浮上しており、Bergmann et al. (2021) が3次元データセットを導入したが、標準ベースラインモデルはまだ存在せず、重要な未解決課題であると示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。