Skip to main content
QUICK REVIEW

[論文レビュー] DiAD: A Diffusion-based Framework for Multi-class Anomaly Detection

Haoyang He, Jiangning Zhang|arXiv (Cornell University)|Dec 11, 2023
Anomaly Detection Techniques and Applications被引用数 7
ひとこと要約

DiAD は、画素空間オートエンコーダ、Stable Diffusion に接続されたセマンティックガイドド(SG)ノイズ除去ネットワーク、および空間認識特徴統合(SFF)ブロックを組み合わせた、マルチクラス異常検出のための画質に基づくフレームワークを提案する。このフレームワークは、意味的整合性を保持し、大規模な異常領域を再構築する能力を有し、MVTec-AD データセットで異常検出および局在化において最先端の性能を達成し、97.2 AUROC および 96.8 AP を記録した。

ABSTRACT

Reconstruction-based approaches have achieved remarkable outcomes in anomaly detection. The exceptional image reconstruction capabilities of recently popular diffusion models have sparked research efforts to utilize them for enhanced reconstruction of anomalous images. Nonetheless, these methods might face challenges related to the preservation of image categories and pixel-wise structural integrity in the more practical multi-class setting. To solve the above problems, we propose a Difusion-based Anomaly Detection (DiAD) framework for multi-class anomaly detection, which consists of a pixel-space autoencoder, a latent-space Semantic-Guided (SG) network with a connection to the stable diffusion's denoising network, and a feature-space pre-trained feature extractor. Firstly, The SG network is proposed for reconstructing anomalous regions while preserving the original image's semantic information. Secondly, we introduce Spatial-aware Feature Fusion (SFF) block to maximize reconstruction accuracy when dealing with extensively reconstructed areas. Thirdly, the input and reconstructed images are processed by a pre-trained feature extractor to generate anomaly maps based on features extracted at different scales. Experiments on MVTec-AD and VisA datasets demonstrate the effectiveness of our approach which surpasses the state-of-the-art methods, e.g., achieving 96.8/52.6 and 97.2/99.0 (AUROC/AP) for localization and detection respectively on multi-class MVTec-AD dataset. Code will be available at https://lewandofskee.github.io/projects/diad.

研究の動機と目的

  • 既存の画質モデルがマルチクラス異常検出において抱える限界、特に再構築時のカテゴリーや意味的混乱を是正すること。
  • 異常領域の再構築時に、元の画像の意味的整合性と構造的詳細を維持しながら、クラス識別を保つこと。
  • マルチスケール特徴を効果的に統合することで、大規模な欠険の再構築精度を向上させること。
  • クラス固有のファインチューニングを必要とせず、複数のオブジェクトクラスに一般化可能な堅牢な教師なしフレームワークを構築すること。
  • 標準ベンチマークで、異常局在化および分類の両面において最先端の性能を達成すること。

提案手法

  • 入力画像を画素空間で再構築するための画素空間オートエンコーダを用い、入力と出力の直接比較を可能にする。
  • Stable Diffusion のノイズ除去 U-Net に接続されたセマンティックガイドド(SG)ノイズ除去ネットワークを導入し、再構築中に意味的整合性を保証する。
  • インスタンス正則化と SiLU 活性化関数を用いて複数スケールの特徴を統合する空間認識特徴統合(SFF)ブロックを採用し、再構築の忠実度を向上させる。
  • 事前学習済み ImageNet バックボーン(例:ResNet50、WideResNet101)を用いて、入力画像および再構築画像からのマルチスケール特徴を抽出する。
  • 異なる層での特徴マップ間のコサイン類似度を計算することで異常スコアを算出し、最適なパフォーマンスを得るため f2、f3、f4 層に焦点を当てる。
  • 再構築の前に、調整可能なステップ数で段階的にノイズを加える前向きの画質化を適用し、再構築品質を向上させる。

実験結果

リサーチクエスチョン

  • RQ1マルチクラス設定下で、画質ベースのフレームワークは、元の画像の意味的クラスと構造的詳細を保持しつつ、異常領域を効果的に再構築できるか?
  • RQ2Stable Diffusion に統合されたセマンティックガイドドノイズ除去ネットワークは、標準的な画質モデルに比べて再構築忠実度をどのように向上させるか?
  • RQ3空間認識特徴統合機構は、大規模な異常に対して再構築精度をどの程度向上させるか?
  • RQ4どの事前学習済み特徴抽出器と特徴層が、分類およびセグメンテーションタスクにおける最良の異常検出パフォーマンスをもたらすか?
  • RQ5前向き画質化のステップ数は、最終的な再構築品質および異常検出パフォーマンスにどのように影響するか?

主な発見

  • DiAD は MVTec-AD データセットで異常検出に 97.2 AUROC および 96.8 AP を達成し、先行する SOTA メソッドを顕著に上回った。
  • VisA データセットでは、局在化と検出にそれぞれ 96.8 AUROC および 99.0 AP を達成し、多様な異常タイプにわたる優れた一般化性能を示した。
  • アブレーションスタディの結果、バックボーンに ResNet50 を使用した場合、分類性能が最良(97.2 AUROC)であり、WideResNet101 はセグメンテーションで優れた性能(56.4 F1max)を示した。
  • IN+SiLU 活性化関数を備えた SFF ブロックは BN+ReLU を上回り、SG ネットワークと組み合わせて 97.2 AUROC および 96.8 AP を達成した。
  • f2、f3、f4 層(64×64、32×32、16×16)の特徴マップを用いることで最高のパフォーマンスが得られ、MVTec-AD で 97.2 AUROC および 99.0 AP を記録した。
  • 前向き画質化のステップ数を 600 を超えて増加させると再構築品質が向上するが、ステップ数が低すぎると(例:600 未満)性能が急激に低下し、効果的なノイズ除去のための臨界閾値があることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。