Skip to main content
QUICK REVIEW

[論文レビュー] DeSTSeg: Segmentation Guided Denoising Student-Teacher for Anomaly Detection

Xuan Zhang, Shiyu Li|arXiv (Cornell University)|Nov 21, 2022
Anomaly Detection Techniques and Applications被引用数 4
ひとこと要約

DeSTSegは、合成された汚染された入力を用いてクリーンな特徴を再構築するように訓練される学生ネットワークを用いて、特徴の識別性を向上させるノイズ除去型学生・教師フレームワークを提案する。同時に、可 trainableなセグメンテーションネットワークを用いて多段階特徴差分を適応的に統合する。この手法は、MVTec ADベンチマークで98.6%の画像レベルAUC、75.8%のピクセルレベルAP、76.4%のインスタンスレベルAPを達成し、最先端の性能を発揮する。

ABSTRACT

Visual anomaly detection, an important problem in computer vision, is usually formulated as a one-class classification and segmentation task. The student-teacher (S-T) framework has proved to be effective in solving this challenge. However, previous works based on S-T only empirically applied constraints on normal data and fused multi-level information. In this study, we propose an improved model called DeSTSeg, which integrates a pre-trained teacher network, a denoising student encoder-decoder, and a segmentation network into one framework. First, to strengthen the constraints on anomalous data, we introduce a denoising procedure that allows the student network to learn more robust representations. From synthetically corrupted normal images, we train the student network to match the teacher network feature of the same images without corruption. Second, to fuse the multi-level S-T features adaptively, we train a segmentation network with rich supervision from synthetic anomaly masks, achieving a substantial performance improvement. Experiments on the industrial inspection benchmark dataset demonstrate that our method achieves state-of-the-art performance, 98.6% on image-level AUC, 75.8% on pixel-level average precision, and 76.4% on instance-level average precision.

研究の動機と目的

  • 既存の学生・教師フレームワークが、異常サンプルの特徴を明示的に制約せずに生成するための特徴の識別性に欠けるという限界を是正すること。
  • 経験的集約を置き換えることで、異常検出における多段階特徴統合を改善すること。
  • 合成された異常を用いたノイズ除去学習の目的関数を導入することで、ロバストネスと表現学習を向上させること。
  • 画像レベル、ピクセルレベル、インスタンスレベルの異常検出ベンチマークで最先端の性能を達成すること。

提案手法

  • 合成された汚染された正常画像を入力として、教師ネットワークの出力からクリーンな特徴を再構築するように、ノイズ除去型学生エンコーダ・デコーダネットワークを訓練する。
  • 学生ネットワークは、同じ画像における出力と教師の出力の特徴差を最小化するように訓練され、効果的に特徴のノイズ除去を学習する。
  • 合成された異常マスクからの豊富な監視情報を用いて、学生・教師ネットワークからの多段階特徴差分を適応的に統合するセグメンテーションネットワークを訓練する。
  • セグメンテーションネットワークの入力は、学生と教師のネットワークからの正規化された特徴マップの要素ごとの積であり、特徴情報と事前知識のバランスを取る。
  • セグメンテーションネットワークはL1損失を用いて異常スコアマップの予測を監視し、局所化精度を向上させる。
  • 全体のフレームワークは、事前学習済みの教師、ノイズ除去型学生、およびトレーニング可能なセグメンテーションヘッドを統合したエンド・ツー・エンドのトレーニングパイプラインである。

実験結果

リサーチクエスチョン

  • RQ1ノイズ除去学習の目的関数は、学生・教師フレームワークにおける正常と異常サンプルの特徴識別性を向上させることができるか?
  • RQ2経験的多段階特徴統合をトレーニング可能なセグメンテーションネットワークに置き換えることで、より良い異常局所化が達成できるか?
  • RQ3合成された異常マスクを用いてセグメンテーションネットワークを監視することは、性能向上にどの程度効果的か?
  • RQ4ノイズ除去、エンコーダ・デコーダアーキテクチャ、およびセグメンテーションヘッドの各コンポonentが全体の性能に果たす寄与度は何か?

主な発見

  • DeSTSegはMVTec ADベンチマークで98.6%の画像レベルAUCを達成し、先行する最先端手法より0.1%高い性能を示した。
  • ピクセルレベルの平均精度は75.8%に達し、前回のSOTAより5.6%の向上を示した。
  • インスタンスレベルの平均精度は76.4%に達し、前回の最良手法より4.9%の向上を示した。
  • アブレーションスタディの結果、ノイズ除去学習、エンコーダ・デコーダアーキテクチャ、およびセグメンテーションヘッドの組み合わせが最良の性能をもたらすことが確認された。
  • セグメンテーションヘッドにおけるL1損失は性能向上に寄与し、98.6%のAUCと75.8%のAPを達成した。
  • 正規化されたS-T特徴の要素ごとの積は、入力としての連結やコサイン距離よりも効果的であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。