[論文レビュー] PaDiM: a Patch Distribution Modeling Framework for Anomaly Detection and Localization
PaDiM は、事前学習済み畳み込みニューラルネットワーク(CNN)と多次元ガウス分布を用いて、正常画像パッチの分布をモデル化する、一貫性のある異常検出および局所化フレームワークを提案する。MVTec AD および STC データセットにおいて、推論時間とメモリ複雑性が低く、特に非整合データに対して優れた性能を発揮し、最先端の性能を達成している。
We present a new framework for Patch Distribution Modeling, PaDiM, to concurrently detect and localize anomalies in images in a one-class learning setting. PaDiM makes use of a pretrained convolutional neural network (CNN) for patch embedding, and of multivariate Gaussian distributions to get a probabilistic representation of the normal class. It also exploits correlations between the different semantic levels of CNN to better localize anomalies. PaDiM outperforms current state-of-the-art approaches for both anomaly detection and localization on the MVTec AD and STC datasets. To match real-world visual industrial inspection, we extend the evaluation protocol to assess performance of anomaly localization algorithms on non-aligned dataset. The state-of-the-art performance and low complexity of PaDiM make it a good candidate for many industrial applications.
研究の動機と目的
- 異常がまれでラベルのない産業用視覚検査における異常検出と局所化の課題に対処すること。
- 推論時に K-NN や微調整済みディープネットワークに依存する既存手法のスケーラビリティの問題を克服すること。
- 実世界の展開に適した、トレーニングデータセットのサイズに依存しない低時間・低メモリ複雑性の手法を開発すること。
- 事前学習済み CNN の複数の意味的レベル間の相関をモデル化することで、局所化の正確性を向上させること。
- 非整合データセットへの評価を拡張し、実世界の産業用検査状況をよりよく反映すること。
提案手法
- 複数の特徴マップ層からのパッチレベルの埋め込みを抽出するために、事前学習済み畳み込みニューラルネットワーク(CNN)を用いる。
- トレーニング埋め込みから学習された平均 μ と共分散 Σ を用いて、各空間的パッチ位置を多次元ガウス分布としてモデル化する。
- CNN の異なる意味的レベル間の相関を活用することで、局所化の精度を向上させる。
- 複数の層からの情報を統合して、埋め込み空間におけるマハラノビス距離を用いて異常スコアを計算する。
- 深層ネットワークのトレーニングをテスト時に実行しない、パッチベースの非パrametric的手法を採用する。
- 精度と推論速度のバランスを取るために、柔軟なバックボーン選択(例:ResNet-18, ResNet-50)をサポートする。
実験結果
リサーチクエスチョン
- RQ1事前学習済み CNN を用いたパッチ分布モデリングアプローチは、異常検出および局所化で最先端の性能を達成できるか?
- RQ2非整合データセットにおいて PaDiM は、実世界の産業用検査状況をよりよく反映する上で、どのように性能を発揮するか?
- RQ3CNN 特徴のクロスレベル相関をモデル化することで、単一レベルアプローチと比較して局所化の正確性が向上するか?
- RQ4PaDiM は、K-NN に基づく手法やオートエンコーダーに基づく手法と比較して、推論時間とメモリ使用量を低く保ちながらも性能を上回ることができるか?
- RQ5入力解像度およびデータセットサイズの増加に伴い、時間的・メモリ的複雑性の観点から、PaDiM のスケーリング特性はいかなるものか?
主な発見
- 非整合 MVTec AD ベンチマークにおいて、PaDiM はすべてのテクスチャクラスで 92.4% の AUROC を達成し、すべてのクラスで 92.2% を記録した。
- STC データセットでは、PaDiM-WR50-Rd550 がオブジェクトクラスで 92.1% の AUROC、PRO スコアで 70.8% を達成し、VAE や SPADE を上回った。
- 非整合 MVTec AD において、PaDiM の性能低下はたった 5.3 パercantage ポints にとどまり、VAE と SPADE がそれぞれ 12.2 および 8.8 パーセンテージポイント低下したのと比較して顕著に優れている。
- MVTec AD における PaDiM-WR50-Rd550 の推論時間は 0.95 秒(CPU)であり、同じバックボーンを用いた SPADE の 7.10 秒と比べて顕著に高速であった。
- PaDiM のメモリ使用量はトレーニングセットサイズに依存せず、MVTec AD では 3.8 GB、STC では 5.2 GB にとどまり、STC における SPADE の 37.0 GB と比べて著しく低い。
- PaDiM のトレーニング時間は MVTec AD でクラスあたり 150 秒(CPU)であり、GPU を使用する VAE のクラスあたり 2 時間 40 分と比べてはるかに高速で、微調整を一切行わない。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。