Skip to main content
QUICK REVIEW

[論文レビュー] Dual-Image Enhanced CLIP for Zero-Shot Anomaly Detection

Zhaoxiang Zhang, Hanqiu Deng|arXiv (Cornell University)|May 8, 2024
Radiation Detection and Scintillator Technologies被引用数 4
ひとこと要約

本稿では、二つの非ペairedなテスト画像を相互に視覚的リファレンスとして併用することで、異常分類および局所化を向上させるゼロショット異常検出フレームワーク、Dual-Image Enhanced CLIPを提案する。さらに、疑似異常生成を組み込んだテスト時適応(TTA)モジュールを統合することで、追加学習なしにMVTecADおよびVisAベンチマークで最先端の性能を達成した。視覚的・言語的特徴の統合スコアリングと視覚的リファレンスの強化の有効性が示された。

ABSTRACT

Image Anomaly Detection has been a challenging task in Computer Vision field. The advent of Vision-Language models, particularly the rise of CLIP-based frameworks, has opened new avenues for zero-shot anomaly detection. Recent studies have explored the use of CLIP by aligning images with normal and prompt descriptions. However, the exclusive dependence on textual guidance often falls short, highlighting the critical importance of additional visual references. In this work, we introduce a Dual-Image Enhanced CLIP approach, leveraging a joint vision-language scoring system. Our methods process pairs of images, utilizing each as a visual reference for the other, thereby enriching the inference process with visual context. This dual-image strategy markedly enhanced both anomaly classification and localization performances. Furthermore, we have strengthened our model with a test-time adaptation module that incorporates synthesized anomalies to refine localization capabilities. Our approach significantly exploits the potential of vision-language joint anomaly detection and demonstrates comparable performance with current SOTA methods across various datasets.

研究の動機と目的

  • CLIPベースのゼロショット異常検出におけるテキストのみのガイダンスの限界を是正すること。特に、微細な視覚的異常を捉えきれない問題を解決する。
  • 推論時に各画像を相互に視覚的リファレンスとして用いる二画像入力戦略を導入することで、異常検出性能を向上させること。
  • テスト時適応(TTA)モジュールを用いて疑似異常を合成し、視覚的表現を精緻化することで、局所化精度を向上させること。
  • 微調整に依存しないインダクティブな学習設定において、強力なゼロショット性能を達成すること。
  • 視覚言語モデルにおける視覚的および言語的特徴の相乗効果を、細粒度な異常検出に応用することを探索すること。

提案手法

  • フレームワークは、ラベルなしのテスト画像ペアを処理し、推論時にそれぞれの画像を相手の視覚的リファレンスとして用いることで、特徴空間を豊かにする。
  • 異常は、テキストプロンプトとクロス画像間の視覚的類似性を統合した、共同視覚言語スコアリング機構により検出される。
  • テスト時適応(TTA)モジュールを導入し、DRAEMにインspiredされた疑似異常生成を用いて推論時に視覚的特徴を精緻化する。
  • TTAモジュールは2ステップの訓練を実施し、異常局所化および分類のAUROCおよびPROスコアを最適化する。
  • 微調整は一切不要であり、すべての向上効果は推論時処理と視覚的リファレンス統合に起因する。
  • モデルはCLIPの視覚および言語エンコーダーを用いて対照的埋め込みを計算し、異常スコアはクロスモality類似性から導出される。

実験結果

リサーチクエスチョン

  • RQ1相互に非ペアな二枚の画像を視覚的リファレンスとして併用することで、テキストのみのプロンプトに比べてゼロショット異常検出性能が向上するか?
  • RQ2他の画像からの視覚的リファレンスを組み込むことで、微細な異常の検出および局所化能力にどのような影響を与えるか?
  • RQ3疑似異常生成を用いたテスト時適応により、事前学習済みCLIPモデルの局所化性能はどの程度向上するか?
  • RQ4視覚的および言語的情報の統合は、単独で用いる場合よりもより頑健な異常検出を実現するか?
  • RQ5微調整を回避するフレームワークでも、ゼロショットインダクティブ異常検出において最先端の性能を達成できるか?

主な発見

  • 二画像入力戦略により、異常分類(AUROC)および局所化(PRO)の両方の性能が顕著に向上し、TTAと組み合わせた場合、MVTecADでAUROCが93.2%に達した。
  • 疑似異常生成を用いたTTAモジュールにより、F1Maxは42.4、PROは84.0に向上し、局所化のバランスが改善された。
  • 最適なパフォーマンスはTTAの訓練ステップ数が2のときであり、それ以上のステップ数では性能が低下した。
  • ゼロショットインダクティブ学習設定において、MVTecADおよびVisAで最先端の性能を達成し、多数の最先端ベースラインを上回った。
  • リファレンス画像に異常を含んでも、依然として効果的なリファレンスとして機能することが示され、リファレンスペアにおける視覚的ノイズに対するロバストネスが裏付けられた。
  • 視覚的・言語的特徴の統合スコアリング機構により、断線したケーブルや誤配置された物体といった複雑な異常の検出精度が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。