Skip to main content
QUICK REVIEW

[論文レビュー] Zero-Shot Anomaly Detection with Pre-trained Segmentation Models

Matthew Baugh, James Batten|arXiv (Cornell University)|Jun 15, 2023
Anomaly Detection Techniques and Applications被引用数 4
ひとこと要約

本論文は、WinCLIPを強化するためにゼロショットセグメンテーションモデルを統合することで、局所化性能を向上させるゼロショット異常検出手法を提案する。前景インスタンスセグメンテーションとCLIPベースのプロンプティング、およびマルチレベル予測集約を組み合わせることで、VisAデータセットにおいてサンプルレベルで81.5のF1-maxスコア、ピクセルレベルで24.2のスコアを達成し、VAND 2023チャレンジで第3位を記録する最先端の性能を実現した。

ABSTRACT

This technical report outlines our submission to the zero-shot track of the Visual Anomaly and Novelty Detection (VAND) 2023 Challenge. Building on the performance of the WINCLIP framework, we aim to enhance the system's localization capabilities by integrating zero-shot segmentation models. In addition, we perform foreground instance segmentation which enables the model to focus on the relevant parts of the image, thus allowing the models to better identify small or subtle deviations. Our pipeline requires no external data or information, allowing for it to be directly applied to new datasets. Our team (Variance Vigilance Vanguard) ranked third in the zero-shot track of the VAND challenge, and achieve an average F1-max score of 81.5/24.2 at a sample/pixel level on the VisA dataset.

研究の動機と目的

  • 正常サンプルが僅かにしか入手できない産業分野におけるデータ非効率な異常検出の課題に対処すること。
  • 事前学習済みセグメンテーションモデルを活用することで、ゼロショット異常検出モデルの局所化精度を向上させること。
  • 外部データやファインチューニングを一切必要としないパイプラインを構築し、新しいデータセットへ直接適用可能にすること。
  • VAND 2023チャレンジのゼロショットトラックにおいてVisAデータセットで最先端の性能を達成すること。

提案手法

  • 前景抽出は、二値画像セグメンテーションとSegment Anything Model (SAM) を組み合わせて実施し、SAMの出力を80%のオーバーラップ閾値でフィルタリングすることで真の前景を特定する。
  • 画像タイリングにより、各前景インスタンスを352×352ピクセル以上の正方形タイルに分割し、縦横比の高い物体に対しては長軸に沿って適応的なタイリングを実施してオブジェクト構成を保持する。
  • サンプルレベル分類にはコンポジションプロンプトエンsemblesを用い、ピクセルレベルでの異常局所化に別個の一般名詞プロンプトを適用する。
  • タイルレベルの異常スコアは、プロンプトのCLIP埋め込みと各タイルの画像埋め込み間のコサイン類似度の平均値として計算され、異常プロンプトに対してクラスタ平均化の問題を回避する。
  • ピクセルレベルの予測は、局所化プロンプトを用いたCLIPSegにより生成され、プロンプトセグメンテーションの間で調和平均が適用され、一貫性のある活性化を強調する。
  • 予測集約では、タイルレベルのスコアを統合してピクセルレベルの予測をスケーリングし、最終的な画像空間の予測は重複するタイル出力の平均値と、上位25%の前景コンポonentスコアを組み合わせて形成する。

実験結果

リサーチクエスチョン

  • RQ1追加のトレーニングデータを必要とせずに、ゼロショットセグメンテーションモデルがゼロショット異常検出における局所化性能を向上させることができるか?
  • RQ2前景インスタンスセグメンテーションは、産業用画像における小さなまたは微細な異常の検出をどのように向上させるか?
  • RQ3一般的な異常記述子(例:「欠陥」「損傷」)を用いたCLIPベースのプロンプティングは、標準的なWinCLIPプロンプトに比べて、ピクセルレベルの異常局所化でどれほど優れているか?
  • RQ4タイルレベルとピクセルレベルのマルチレベル予測集約は、全体の検出のロバスト性と正確性をどの程度向上させるか?
  • RQ5完全にゼロショットのパイプラインは、データセット固有の適応なしにVisAで最先端の性能を達成できるか?

主な発見

  • 本手法はVisAデータセットにおいてサンプルレベルで81.5のF1-maxスコアを達成し、WinCLIPベースラインの79.0を上回り、VAND 2023ゼロショットトラックで第3位を記録した。
  • ピクセルレベルでは24.2のF1-maxスコアを達成し、WinCLIPベースラインの14.8および優勝作品APRIL-GANの32.3を大きく上回った。
  • 前景セグメンテーションの統合により、背景の影による誤検出が低減され、特に複雑または細長い形状のオブジェクトに対して焦点が明確になった。
  • CLIPSegのプロンプト出力に調和平均を適用することで、微細な異常におけるピクセルレベルセグメンテーションの一貫性が向上した。
  • 一般化された局所化プロンプト(例:「欠陥」「損傷」)の使用により、全体像のWinCLIPプロンプトを再利用するよりも、異常の局所化がより正確になった。
  • 上位25%の前景コンポーネントスコアを用いた予測集約により、正常領域からのノイズが効果的に低減され、サンプルレベル分類のロバスト性が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。