Skip to main content
QUICK REVIEW

[論文レビュー] Unsupervised Industrial Anomaly Detection via Pattern Generative and Contrastive Networks

Jianfeng Huang, Chenyang Li|arXiv (Cornell University)|Jul 20, 2022
Anomaly Detection Techniques and Applications被引用数 4
ひとこと要約

本論文では、教師なし異常検出手法として、パターン生成と対照的学習を組み合わせたVision Transformer(VIT)ベースの手法を提案する。この手法は、ラベル付きの異常データが不要であるため、産業分野の欠陻検出に適している。VITベースのデコーダーを用いて欠損した画像パッチを再構築し、シアモイズネットワークを用いて生成されたパッチと実際のパッチを比較することで、MVTecで99.8%のAUCを達成し、先行するSOTA手法を上回る性能を発揮した。

ABSTRACT

It is hard to collect enough flaw images for training deep learning network in industrial production. Therefore, existing industrial anomaly detection methods prefer to use CNN-based unsupervised detection and localization network to achieve this task. However, these methods always fail when there are varieties happened in new signals since traditional end-to-end networks suffer barriers of fitting nonlinear model in high-dimensional space. Moreover, they have a memory library by clustering the feature of normal images essentially, which cause it is not robust to texture change. To this end, we propose the Vision Transformer based (VIT-based) unsupervised anomaly detection network. It utilizes a hierarchical task learning and human experience to enhance its interpretability. Our network consists of pattern generation and comparison networks. Pattern generation network uses two VIT-based encoder modules to extract the feature of two consecutive image patches, then uses VIT-based decoder module to learn the human designed style of these features and predict the third image patch. After this, we use the Siamese-based network to compute the similarity of the generation image patch and original image patch. Finally, we refine the anomaly localization by the bi-directional inference strategy. Comparison experiments on public dataset MVTec dataset show our method achieves 99.8% AUC, which surpasses previous state-of-the-art methods. In addition, we give a qualitative illustration on our own leather and cloth datasets. The accurate segment results strongly prove the accuracy of our method in anomaly detection.

研究の動機と目的

  • 産業分野におけるラベル付き欠陻画像の入手困難という課題に対処すること。
  • CNNベースの教師なし手法が複雑なテクスチャの変動や非線形パターンに対処する際の限界を克服すること。
  • 高次元特徴空間におけるテクスチャの変化へのロバスト性と汎化性能を向上させること。
  • 人間が設計したパターン事前知識と階層的タスク学習を組み合わせることで、解釈可能性を向上させること。
  • 産業分野のデータセットにおいて、異常検出および局所化の分野で最先端の性能を達成すること。

提案手法

  • 2つの連続する画像パッチから特徴を抽出するために、Vision Transformer(ViT)ベースのエンコーダーを用いる。
  • エンコーディングされた特徴に基づいて、人間が設計したスタイルパターンをガイドとして用い、ViTベースのデコーダーで3番目の画像パッチを生成する。
  • 生成されたパッチと元の正例パッチの類似度を計算するために、シアモイズネットワークを適用する。
  • 複数の空間的視点からの予測を集約することで、異常局所化の精度を向上させるために、双方向推論を用いる。
  • 人間の経験を統合した階層的タスク学習を用いることで、モデルの解釈可能性と特徴表現を向上させる。
  • 類似度計算を通じた対照的学習を活用し、異常を示す偏差を強調する。

実験結果

リサーチクエスチョン

  • RQ1限られた異常データのもとで、VITベースのアーキテクチャがCNNベースのモデルを上回る性能を示せるか?
  • RQ2人間が設計したスタイル事前知識を用いたパターン生成は、異常検出のロバスト性を向上させるのにどの程度有効か?
  • RQ3生成されたパッチと実際のパッチの間の対照的学習は、局所化精度をどの程度向上させるか?
  • RQ4双方向推論は、異常局所化の整合性と精度を向上させられるか?
  • RQ5本手法は、複雑なテクスチャや変動を示す実世界の産業分野データセットに対しても、どの程度汎化できるか?

主な発見

  • 提案手法は、MVTecベンチマークで99.8%のAUCを達成し、先行する最先端手法を上回った。
  • 独自のレザーおよび生地データセットにおける定性的な結果から、高精度で詳細な異常セグメンテーションが実現された。
  • 分離されたパターン生成と対照的学習のメカニズムにより、テクスチャの変動に対して強いロバスト性を示した。
  • 人間が設計したスタイル事前知識の統合により、高次元空間における解釈可能性と特徴表現が向上した。
  • 双方向推論により、誤検出を低減し、空間的一致性を向上させることで、局所化の精度が顕著に向上した。
  • 公開ベンチマークを超える実世界のデータセットを用いた検証により、未観測の産業素材に対しても良好な汎化性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。