Skip to main content
QUICK REVIEW

[論文レビュー] Can a biologically-plausible hierarchy effectively replace face detection, alignment, and recognition pipelines?

Qianli Liao, Joel Z. Leibo|arXiv (Cornell University)|Nov 16, 2013
Face recognition and analysis参考文献 36被引用数 13
ひとこと要約

本論文は、局所性に敏感なハッシュ化に基づく投票方式である「衝突の共通理解(CoC)」を用いて、従来の顔検出・アライメント・認識パイプラインを、生物学的に妥当な前向きの階層的ネットワークに置き換える手法を提案する。この手法は明示的な検出やアライメントを必要とせず、未アライメントの LFW データセットで 87.55% の精度を達成し、アライメント済みデータで最良の結果を出したシステムと同等の性能を発揮する。また、LFW-jittered や SUFR-W といったより困難なデータセットに対しても、頑健に一般化する。

ABSTRACT

The standard approach to unconstrained face recognition in natural photographs is via a detection, alignment, recognition pipeline. While that approach has achieved impressive results, there are several reasons to be dissatisfied with it, among them is its lack of biological plausibility. A recent theory of invariant recognition by feedforward hierarchical networks, like HMAX, other convolutional networks, or possibly the ventral stream, implies an alternative approach to unconstrained face recognition. This approach accomplishes detection and alignment implicitly by storing transformations of training images (called templates) rather than explicitly detecting and aligning faces at test time. Here we propose a particular locality-sensitive hashing based voting scheme which we call "consensus of collisions" and show that it can be used to approximate the full 3-layer hierarchy implied by the theory. The resulting end-to-end system for unconstrained face recognition operates on photographs of faces taken under natural conditions, e.g., Labeled Faces in the Wild (LFW), without aligning or cropping them, as is normally done. It achieves a drastic improvement in the state of the art on this end-to-end task, reaching the same level of performance as the best systems operating on aligned, closely cropped images (no outside training data). It also performs well on two newer datasets, similar to LFW, but more difficult: LFW-jittered (new here) and SUFR-W.

研究の動機と目的

  • 生物学的に妥当な前向きの階層構造が、制約のない顔認識のための標準的な検出・アライメント・認識(DAR)パイプラインを効果的に置き換えられるかどうかを調査すること。
  • DAR パイプラインの限界、特に生物学的妥当性の欠如と、アライメントおよび検出段階で生じるデータセットバイアスへの対処。
  • 事前処理ステップに依存せず、完全で未アライメントで未クロップされた画像に直接対処できる、スケーラブルでエンドツーエンドのシステムを構築すること。
  • LFW-jittered や SUFR-W のようなより困難な新しいデータセットを用いて、分布シフトに対する頑健性を評価すること。
  • 階層的テンプレートベースのシステムが、検出およびアライメント段階を明示的に必要とせずに、並進、スケール、回転に対して不変性を達成できることを示し、専用の検出およびアライメント段階の必要性を疑問視すること。

提案手法

  • 理論的モデルに基づく階層的ネットワークにおける不変認識の仕組みを模倣した、3層構造の前向き階層を採用。訓練画像を変換済みのテンプレートとして格納。
  • 空間およびスケールにおけるフル畳み込みの効率的近似を実現するため、新しい局所性に敏感なハッシュ化(LSH)スキームを採用。計算コストを低減。
  • 「衝突の共通理解(CoC)」投票メカニズムにより、複数のハッシュテーブルに共通する特徴を特定し、マッチングされるテンプレートを検出。高速かつ頑健な特徴マッチングを実現。
  • 入力として HOG および LBP 特徴を用い、ハッシュコード長が 28 で、20 個のハッシュテーブルを用いて、画像のシグネチャ表現を生成。
  • テスト画像ペアの3層目シグネチャの差分に、最終的に RBF-SVM クラス分類器を適用し、類似度スコアを計算。
  • 外部データや事前アライメントを一切使用せず、完全で未アライメントの画像上でエンドツーエンドに学習し、LFW、LFW-jittered、SUFR-W データセットでテスト。

実験結果

リサーチクエスチョン

  • RQ1生物学的に妥当な前向きの階層的ネットワークが、明示的な検出やアライメント段階を必要とせずに、競争力のある顔認識性能を達成できるか?
  • RQ2提案された衝突の共通理解(CoC)ハッシュスキームが、フル階層的テンプレートマッチング処理を効果的に近似しつつ、速度とスケーラビリティを維持できるか?
  • RQ3アライメント済みでない、未クロップされた画像に対して、本手法は、アライメント済みデータで学習した最先端のシステムと比較して、どのように性能を発揮するか?
  • RQ4LFW-jittered や SUFR-W データセットで観察されるような、ポーズ、スケール、方向の変動が増加した状況において、本システムは分布シフトに対して頑健か?
  • RQ5本システムは、特定のデータ分布に過学習しているわけではないか、異なるデータセット間で一般化できるか?

主な発見

  • 提案されたシステムは、外部学習データを一切使用せず、未アライメントの LFW データセットで 87.55% の精度を達成。これは、密にクロップされアライメントされた画像で動作する最良のシステムと同等の性能。
  • 並進、スケール、平面内回転の大きな変動を含むより困難な LFW-jittered データセットでは、87.45% の精度を維持。一方、ベースラインの HOG+SVM は 55.28% に低下。
  • データセット間での一般化性能が良好である:SUFR-W で学習し LFW でテストすると 84.55% の精度を達成。逆に LFW で学習し SUFR-W でテストしても同様に高い性能を示し、データセットバイアスに対して頑健であることを示す。
  • HOG+LBP 特徴と RBF-SVM を用いた場合でも、87.55% の精度を達成。これは、「未アライメントかつ外部データを使用しない」カテゴリで最先端の手法を上回る性能。
  • 過学習によるものではないことが示され、本システムはデータセット間で一般化し、顕著な画像の摂動に対しても高い精度を維持している。
  • 結果は、階層ネットワークにおける大規模なテンプレートが、ゴミの影響を緩和でき、全体的な顔処理効果(例:複合顔効果)を説明できることを支持する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。