Skip to main content
QUICK REVIEW

[論文レビュー] Detecting Anomalous Faces with 'No Peeking' Autoencoders

Anand Bhattad, Jason Rock|arXiv (Cornell University)|Feb 15, 2018
Anomaly Detection Techniques and Applications参考文献 21被引用数 7
ひとこと要約

本稿では、正常な顔画像のみを用いて欠損画像パッチを補完するように訓練された自己符号化器を用い、真のパッチ内容を「のぞき見」できないように制約を課すことで、異常な顔を検出する新しい「のぞき見禁止」自己符号化器手法を提案する。再構成誤差に基づいて異常度スコアを算出し、教師ありおよび教師なし設定の両方で強力なベースラインを上回り、まれな異常に対しても高い検出率を達成するとともに、さまざまなデータセットサイズに対して高い頑健性を示す。

ABSTRACT

Detecting anomalous faces has important applications. For example, a system might tell when a train driver is incapacitated by a medical event, and assist in adopting a safe recovery strategy. These applications are demanding, because they require accurate detection of rare anomalies that may be seen only at runtime. Such a setting causes supervised methods to perform poorly. We describe a method for detecting an anomalous face image that meets these requirements. We construct a feature vector that reliably has large entries for anomalous images, then use various simple unsupervised methods to score the image based on the feature. Obvious constructions (autoencoder codes; autoencoder residuals) are defeated by a 'peeking' behavior in autoencoders. Our feature construction removes rectangular patches from the image, predicts the likely content of the patch conditioned on the rest of the image using a specially trained autoencoder, then compares the result to the image. High scores suggest that the patch was difficult for an autoencoder to predict, and so is likely anomalous. We demonstrate that our method can identify real anomalous face images in pools of typical images, taken from celeb-A, that is much larger than usual in state-of-the-art experiments. A control experiment based on our method with another set of normal celebrity images - a 'typical set', but nonceleb-A are not identified as anomalous; confirms this is not due to special properties of celeb-A.

研究の動機と目的

  • 異常学習データが入手できない状況下で、視覚的に類似したがまれな異常顔画像を検出する課題に対処すること。
  • 通常の顔と異常顔の間の微細な差を顕著にする特徴表現を開発し、効果的な異常検出を可能にすること。
  • 実際の異常顔と通常顔画像を組み合わせた新しいベンチマークデータセットを用いて、Celeb-Aデータセットを拡張して評価すること。
  • 最小限の仮定で、教師ありおよび教師なしの異常検出設定の両方で有効性を示すこと。

提案手法

  • 本手法は、周囲のコンテキストに基づいて顔画像内の欠損矩形パッチを予測する特別に訓練された自己符号化器を用いる。
  • 「のぞき見禁止」制約により、訓練中に真のパッチ内容にアクセスできないようにすることで、汎用的な再構成パターンを学習させることを保証する。
  • 予測されたパッチ内容と実際の内容との間の再構成誤差(残差)を測定することで異常を検出する。高い誤差は異常を示唆する。
  • 残差特徴は、マハラノビス距離や局所的誤り発見率(lfdr)といったシンプルな教師なしスコアリング手法と組み合わせて使用する。
  • 特徴の正規化には、極端な値をトリミングすることで平均と共分散を頑健に推定する手法を用い、特徴が概ね独立同分布に従うと仮定する。
  • 本手法は、実際の異常顔画像と通常顔画像のセットを含む新しいベンチマークを用いて評価され、データセットサイズの違いを考慮した公平な比較が可能となる。

実験結果

リサーチクエスチョン

  • RQ1正常顔画像のみで訓練された自己符号化器が、視覚的に類似しているがまれな異常顔画像を検出できるか?
  • RQ2モデルが真のパッチ内容を「のぞき見」できない状況下で、入力補完に基づく再構成誤差が信頼できる異常スコアとして機能するか?
  • RQ3本手法は、マハラノビス距離を用いたResNet-50といった強力なベースラインと比較して、教師なし異常検出において優れているか?
  • RQ4本手法は、訓練時に異常例を必要とせずに、未観測の異常タイプにも一般化できるか?
  • RQ5候補画像の数が増加するにつれて、性能が低下するか、それとも安定を保つのか?

主な発見

  • 提案された入力補完ベースの自己符号化器の残差特徴は、ResNet-50にマハラノビス距離を適用したベースラインを含め、あらゆるデータセットサイズで顕著に優れた性能を示した。
  • 128枚の画像セットにおいて、異常画像は常に上位10件以内にランク付けされた一方、16枚を超えるセットでは通常画像は一度も上位10位以内にランクされなかった。
  • 16枚の画像セットにおいて、異常画像の再現率は40%に達したが、通常画像は20%にとどまり、明確な性能差が確認された。
  • 本手法はデータセットサイズの変化に対して頑健であり、候補画像数が増加しても高い検出率を維持した。
  • Celeb-A以外の通常顔セットを用いた制御実験により、本手法がCeleb-A固有のデータ特性に依存しているわけではないことが確認された。
  • 標準化されたL-infinityスコアに対する局所的誤り発見率(lfdr)推定により、異常画像が一貫して高い懸念度としてランク付けされた一方、通常画像はほとんどフラグが立たなかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。