Skip to main content
QUICK REVIEW

[論文レビュー] Supervised Transformer Network for Efficient Face Detection

Dong Chen, Gang Hua|arXiv (Cornell University)|Jul 19, 2016
Face recognition and analysis参考文献 10被引用数 18
ひとこと要約

本論文は、マルチタスク領域提案ネットワーク(RPN)とRCNNを段階的かつエンド・トゥ・エンドで学習可能なアーキテクチャで組み合わせた、効率的な顔検出のための教師あり変換ネットワーク(STN)を提案する。RPNは顔候補と顔面特徴点を検出するが、その後、教師あり変換層によって特徴点を標準化されたポーズに変換する。両段階からの特徴マップが連結され、最終的な分類に用いられる。本手法は、ROI畳み込み方式を用いることで効率化され、VGA解像度の画像に対して1コアのCPUで30 FPSで実行され、最先端の精度を達成する。

ABSTRACT

Large pose variations remain to be a challenge that confronts real-word face detection. We propose a new cascaded Convolutional Neural Network, dubbed the name Supervised Transformer Network, to address this challenge. The first stage is a multi-task Region Proposal Network (RPN), which simultaneously predicts candidate face regions along with associated facial landmarks. The candidate regions are then warped by mapping the detected facial landmarks to their canonical positions to better normalize the face patterns. The second stage, which is a RCNN, then verifies if the warped candidate regions are valid faces or not. We conduct end-to-end learning of the cascaded network, including optimizing the canonical positions of the facial landmarks. This supervised learning of the transformations automatically selects the best scale to differentiate face/non-face patterns. By combining feature maps from both stages of the network, we achieve state-of-the-art detection accuracies on several public benchmarks. For real-time performance, we run the cascaded network only on regions of interests produced from a boosting cascade face detector. Our detector runs at 30 FPS on a single CPU core for a VGA-resolution image.

研究の動機と目的

  • 実世界の顔検出における顕著なポーズ変動の課題に対処すること。
  • 非正面および困難な顔ポーズにおける検出精度を向上させること。
  • 計算コストを低減することで、CPU上でリアルタイム推論を可能にすること。
  • エンド・トゥ・エンドで最適な標準化された特徴点位置を学習する、画期的な教師あり変換層を導入すること。
  • ROIベースの計算を用いることで、最小限の精度低下で最先端の性能を達成すること。

提案手法

  • 段階的な2段階ネットワーク:まずマルチタスクRPNが顔候補と顔面特徴点を予測する。
  • 検出された特徴点が学習済みの標準化された位置にマッピングされる教師あり変換層を用いて、候補領域を変形する。
  • 変形された領域は、2段階目のRCNNで分類され、最終的な顔/非顔の検証が行われる。
  • 両段階からの特徴マップが連結され、より優れた識別性を持つ統合表現が得られる。
  • 標準化された特徴点位置は、学習プロセス全体の中でエンド・トゥ・エンドで最適化される。
  • ROI畳み込み方式により、DNNの演算が検出された領域のみに制限され、CPU上での計算量が顕著に削減される。

実験結果

リサーチクエスチョン

  • RQ1検出とアライメントを統合した段階的CNNのエンド・トゥ・エンド学習が、顕著なポーズ変動に対して頑健性を向上させられるか?
  • RQ2標準化された顔ポーズを学習する教師あり変換層が、非教師ありまたは回帰ベースの正規化を上回れるか?
  • RQ32段階からのマルチスケール特徴を組み合わせることで、最先端の精度を達成しつつリアルタイム性能を維持できるか?
  • RQ4ROIベースの畳み込みは、リコール率の低下を最小限に抑えながら、CPU上での推論時間をどの程度短縮できるか?
  • RQ5非トップK抑制が、NMSに比べてリコール率を維持しながら誤検出を低減できるか?

主な発見

  • 提案された教師あり変換ネットワークは、FDDB、AFW、PASCAL Facesベンチマークで最先端の検出精度を達成した。
  • 本手法は、VGA解像度の画像に対して1コアのCPUで30 FPSで動作する。
  • ROI畳み込みにより、計算量が最大3倍まで削減され、フル画像推論と比較してリコール率の低下はたった0.6%にとどまる。
  • 非トップK抑制(K=5)は89.4%のリコール率を達成し、同じ候補数条件下でNMS(88.7%)を上回った。
  • 標準化された特徴点位置のエンド・トゥ・エンド学習により、特徴の識別性が向上し、顔/非顔の分離がより良くなる。
  • ポーズ正規化変換層のおかげで、極端なポーズ変動に対しても高い精度を維持できる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。