Skip to main content
QUICK REVIEW

[論文レビュー] CMS-RCNN: Contextual Multi-Scale Region-based CNN for Unconstrained Face Detection

Chenchen Zhu, Yutong Zheng|arXiv (Cornell University)|Jun 17, 2016
Face recognition and analysis被引用数 15
ひとこと要約

CMS-RCNN は、多スケール特徴と明示的なボディコンテキスト推論を統合することで、遮蔽、低解像度、ポーズ変動などの極端な条件下でも頑健な非制約的顔検出を実現する文脈的マルチスケール領域ベースのCNNを提案する。WIDER FACE では最先端の性能を達成し、FDDB では競争力のある結果を示し、すべての難易度パーティションで強力なベースラインを上回る。

ABSTRACT

Robust face detection in the wild is one of the ultimate components to support various facial related problems, i.e. unconstrained face recognition, facial periocular recognition, facial landmarking and pose estimation, facial expression recognition, 3D facial model construction, etc. Although the face detection problem has been intensely studied for decades with various commercial applications, it still meets problems in some real-world scenarios due to numerous challenges, e.g. heavy facial occlusions, extremely low resolutions, strong illumination, exceptionally pose variations, image or video compression artifacts, etc. In this paper, we present a face detection approach named Contextual Multi-Scale Region-based Convolution Neural Network (CMS-RCNN) to robustly solve the problems mentioned above. Similar to the region-based CNNs, our proposed network consists of the region proposal component and the region-of-interest (RoI) detection component. However, far apart of that network, there are two main contributions in our proposed network that play a significant role to achieve the state-of-the-art performance in face detection. Firstly, the multi-scale information is grouped both in region proposal and RoI detection to deal with tiny face regions. Secondly, our proposed network allows explicit body contextual reasoning in the network inspired from the intuition of human vision system. The proposed approach is benchmarked on two recent challenging face detection databases, i.e. the WIDER FACE Dataset which contains high degree of variability, as well as the Face Detection Dataset and Benchmark (FDDB). The experimental results show that our proposed approach trained on WIDER FACE Dataset outperforms strong baselines on WIDER FACE Dataset by a large margin, and consistently achieves competitive results on FDDB against the recent state-of-the-art face detection methods.

研究の動機と目的

  • 非制約的環境における遮蔽、照明、ポーズ、解像度の極端な変動に起因する顔検出の困難な課題に対処すること。
  • 人間の視覚認識を模倣して、周囲のボディ領域からの文脈的情報を明示的にモデル化することで検出性能を向上させること。
  • 小さな顔や極めて小さな顔の信頼性ある検出を実現するため、領域提案段階および検出段階の両方でマルチスケール特徴学習を強化すること。
  • 現実的で困難な条件下で、WIDER FACE や FDDB などのベンチマークデータセットにおいて最先端の性能を達成すること。

提案手法

  • ネットワークは、小さな顔や極めて小さな顔を検出できるように、複数のスケールで特徴を捉えることができるマルチスケール領域提案ネットワーク(MS-RPN)を採用している。
  • 領域提案に対する推論には、高レベルの意味的特徴と低レベルの局所化詳細を統合した文脈的マルチスケールCNN(CMS-CNN)が使用されている。
  • ロイのプーリング層を顔領域の外側の文脈領域を含むように拡張することで、明示的なボディコンテキスト推論を組み込み、人間の視覚的推論を模倣している。
  • 勾配が提案ボックス座標に関して無視されるように、近似的な共同学習の形でモデルを訓練することで、学習の安定性を向上させている。
  • 最終的な検出出力には信頼度スコアとバウンディングボックス回帰が含まれており、信頼度スコアのしきい値を用いて結果がフィルタリングされている。
  • 同じモデルを WIDER FACE で微調整した後、再学習なしに FDDB で評価したところ、優れた一般化性能を示した。

実験結果

リサーチクエスチョン

  • RQ1明示的なボディコンテキストのモデル化は、非制約的環境における顔検出の頑健性を向上させることができるか?
  • RQ2領域提案段階および検出段階でのマルチスケール特徴学習は、小さな顔や極めて小さな顔の性能にどのように影響を与えるか?
  • RQ3文脈的推論は、曖昧または遮蔽された顔のパターンによって引き起こされる誤検出をどの程度低減するか?
  • RQ4WIDER FACE や FDDB といった多様なベンチマークにおいて、提案された CMS-RCNN は最先端の手法と比較してどの程度優れているか?

主な発見

  • CMS-RCNN は、WIDER FACE データセットにおいて、すべての難易度パーティション(簡単、中程度、困難)で強力なベースラインを大きく上回った。
  • WIDER FACE データセットにおいて、困難なパーティションで最高の平均適合率を達成し、極端な変動に対する優れた頑健性を示した。
  • WIDER FACE で学習した同じモデルを FDDB で評価したところ、非常に高いリCALLレートを達成し、多数の発表済み手法を上回った。
  • 誤検出の可視化結果から、多くの誤検出はデータセット内の誤ラベルによるものであることが判明し、モデルのデータノイズに対する頑健性と、曖昧な顔に似たパターンへの一般化能力を示している。
  • アブレーションスタディでは、ボディコンテキスト情報の統合が性能をさらに向上させていることが示され、平均適合率の向上が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。