Skip to main content
QUICK REVIEW

[論文レビュー] Regressing Robust and Discriminative 3D Morphable Models with a very Deep Neural Network

Anh Tran, Tal Hassner|arXiv (Cornell University)|Dec 15, 2016
Face recognition and analysis参考文献 34被引用数 12
ひとこと要約

本論文は、単一の制約のない顔画像から、ロバストで判別力のある3次元モーファブルモデル(3DMM)の形状およびテクスチャパラメータを直接回帰する、非常に深い畳み込みニューラルネットワーク(CNN)を提案する。大規模な合成トレーニングデータセットを生成することで、本手法は最先端の3次元顔再構成精度を達成し、LFW、YTF、IJB-Aベンチマークにおいて競争力ある3次元顔認識を実現した—これは、制約のない環境下で3次元顔形状を解釈可能な表現として初めて成功裏に活用した例である。

ABSTRACT

The 3D shapes of faces are well known to be discriminative. Yet despite this, they are rarely used for face recognition and always under controlled viewing conditions. We claim that this is a symptom of a serious but often overlooked problem with existing methods for single view 3D face reconstruction: when applied "in the wild", their 3D estimates are either unstable and change for different photos of the same subject or they are over-regularized and generic. In response, we describe a robust method for regressing discriminative 3D morphable face models (3DMM). We use a convolutional neural network (CNN) to regress 3DMM shape and texture parameters directly from an input photo. We overcome the shortage of training data required for this purpose by offering a method for generating huge numbers of labeled examples. The 3D estimates produced by our CNN surpass state of the art accuracy on the MICC data set. Coupled with a 3D-3D face matching pipeline, we show the first competitive face recognition results on the LFW, YTF and IJB-A benchmarks using 3D face shapes as representations, rather than the opaque deep feature vectors used by other modern systems.

研究の動機と目的

  • 制約のない、現実世界の状況下における、ロバストで判別力のある3次元顔形状推定の不足を解消すること。
  • 深層CNNのトレーニングデータが不足している問題を、3DMMの事前分布を用いて、さまざまな照明、ポーズ、表情を含む制約のない顔画像と対応する3DMMパラメータを含む大規模な合成データセットを生成することで克服すること。
  • ポーズや照明の変化に対して安定し、過剰正則化や不安定性を避ける、正確な3次元顔再構成を実現すること。
  • 正確に推定された3次元顔形状が、制約のない環境下で顔認識に強力で解釈可能な表現として機能できることを示すこと。
  • 曖昧な深層特徴ではなく3DMMパラメータを用いることで、解釈性とロバスト性を向上させつつ、競争力ある顔認識性能を達成すること。

提案手法

  • 101層の非常に深い残差CNNを訓練し、単一の入力顔画像から3DMM形状およびテクスチャパラメータを直接回帰する。
  • 3DMMの事前分布を用いて、さまざまな制約のない顔画像を合成し、照明、ポーズ、表情を変化させることで大規模な合成トレーニングデータセットを生成する。
  • 3DMM再構成損失を用いて、微分可能レンダリング層を介して弱教師付きのトレーニング戦略を採用する。
  • CNNの後にプーリング層を適用し、未知のポーズや表情に対しても一般化性能を向上させる。
  • 推定された3DMMパラメータを3D-3D顔マッチングパイプラインに統合し、幾何的類似度をマッチング指標として用いる。
  • 3DMMの統計的事前分布を活用してネットワークを正則化し、合成データへの過剰適合を防ぎ、実世界の画像への一般化性能を向上させる。

実験結果

リサーチクエスチョン

  • RQ1限られた実際のラベル付きデータがある中で、非常に深いCNNが制約のない単一顔画像から正確な3DMMパラメータを回帰できるか?
  • RQ2提案された合成データ生成手法が、実世界の制約のない画像にうまく一般化できる、現実的で多様なトレーニング例を生成できるか?
  • RQ3得られた3次元顔再構成は、ポーズや照明の変化に対してロバストであり、かつ顔認識に十分な判別力を持つことができるか?
  • RQ4LFW、YTF、IJB-Aといった標準ベンチマークにおいて、3D顔形状に基づく認識性能は、深層特徴埋め込みを用いた最先端のシステムと比べてどうか?
  • RQ53DMMパラメータは、制約のない環境下で解釈可能でロバストな顔表現として機能できるか?一般的なまたは過剰に正則化された3次元形状を上回る性能を示せるか?

主な発見

  • 提案手法は、MICCデータセットにおいて、表面誤差(mmレベルの精度)を考慮して、既存手法を上回る最先端の3次元顔再構成精度を達成した。
  • LFWベンチマークでは、顔認証で98.5%の精度を達成し、他の3D再構成ベースの手法を上回り、Facebookのマルチ-CNNシステムに近い性能を示した。
  • YTFベンチマークでは、AUCが97.8%に達し、3DDFAや3DMMベースの手法を10ポイント以上上回り、FacebookのCNNアンサンブルシステムに1%以内で近づいた。
  • 挑戦的なIJB-Aベンチマークでは、1:1認証および1:N認識性能において競争力があり、3DDFAや3DMMベースの手法を大きく上回ったが、最新の特化型システムにはまだ劣っていた。
  • 可視的結果から、本手法は鼻や口周辺の誤差が低く、同じ被験者の異なる視点でも一貫性のある3次元形状を生成することがわかった。
  • 失敗事例は主に、3DMM事前分布に存在しない顔のひげや、極端な平面外回転に起因しており、基礎となる3DMM表現の限界を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。