Skip to main content
QUICK REVIEW

[論文レビュー] Joint Face Detection and Facial Motion Retargeting for Multiple Faces

Bindita Chaudhuri, Noranart Vesdapunt|arXiv (Cornell University)|Feb 27, 2019
Face recognition and analysis参考文献 54被引用数 5
ひとこと要約

本論文は、リアルタイムの顔のモーションリターゲティングを実現するため、複数の顔を同時に検出するとともに3次元モーファブルモデル(3DMM)パラメータを回帰するエンドツーエンドのディーブラーニングネットワークを提案する。単一顔データで訓練された分離されたマルチスケールアーキテクチャを活用し、マルチ顔画像に弱教師付きの3DMMの真値を転送することで、極端なポーズや表情に対しても高い検出精度(mAP 98.8%)と頑健性を達成し、スループットとメモリ効率の点でキャスケード手法を上回る性能を発揮する。

ABSTRACT

Facial motion retargeting is an important problem in both computer graphics and vision, which involves capturing the performance of a human face and transferring it to another 3D character. Learning 3D morphable model (3DMM) parameters from 2D face images using convolutional neural networks is common in 2D face alignment, 3D face reconstruction etc. However, existing methods either require an additional face detection step before retargeting or use a cascade of separate networks to perform detection followed by retargeting in a sequence. In this paper, we present a single end-to-end network to jointly predict the bounding box locations and 3DMM parameters for multiple faces. First, we design a novel multitask learning framework that learns a disentangled representation of 3DMM parameters for a single face. Then, we leverage the trained single face model to generate ground truth 3DMM parameters for multiple faces to train another network that performs joint face detection and motion retargeting for images with multiple faces. Experimental results show that our joint detection and retargeting network has high face detection accuracy and is robust to extreme expressions and poses while being faster than state-of-the-art methods.

研究の動機と目的

  • 顔のモーションリターゲティングのため、顔の検出と3DMMフィッティングを別々に実行するキャスケード手法の非効率性と遅延を解消すること。
  • マルチ顔データセットに3DMMパラメータのアノテーションが不足している問題を解決するため、単一顔用3DMMネットワークを用いて弱教師付きの真値を生成すること。
  • アイデンティティ、表情、ポーズ、スケールを分離した3DMMパラメータを学習するマルチタスク学習フレームワークを設計し、表現学習とモデルの一般化性能を向上させること。
  • 計算オーバーヘッドとメモリ使用量を最小限に抑えることで、モバイルプラットフォームへの軽量でリアルタイムな顔のモーションリターゲティングのデプロイを可能にすること。

提案手法

  • クロップされた単一顔画像から分離された3DMMパラメータを回帰するため、ファイアモジュールとスイーブ・エクスカレーションブロックを備えたマルチスケールアーキテクチャを用いて、単一顔ネットワーク(SFN)を訓練する。
  • ポーズとスケールの予測に高レベル特徴を強調し、アイデンティティと表情の予測にマルチスケール特徴を活用することで、より優れた分離性能を実現する。
  • 訓練済みのSFNを用いて、マルチ顔画像内の複数の顔に対して合成された3DMMパラメータを生成し、複数顔ネットワーク(MFN)の訓練に弱教師付きの監督信号を提供する。
  • 1回の順伝播で顔のバウンディングボックスと3DMMパラメータを同時に予測するYOLoにインspiredされたワンショット検出器としてMFNを設計する。
  • スケールプリオンとマルチスケール特徴統合を組み込むことで、極端なポーズや表情に対しても検出の頑健性とパラメータの精度を向上させる。
  • 検出と3DMM回帰の共同訓練を活用し、ネットワークが顔の特徴を排他的に学習するよう促進することで、検出性能とリターゲティング性能の両方を向上させる。

実験結果

リサーチクエスチョン

  • RQ1キャスケード手法よりも高い効率性を実現するため、1つのディーブラーニングネットワークが複数顔の検出と3DMMパラメータの回帰を同時に実行し、顔のモーションリターゲティングを実現できるか?
  • RQ2マルチタスク学習フレームワークにおいて、アイデンティティ、表情、ポーズの変動に強く、分離された3DMMパラメータ予測をどのように達成できるか?
  • RQ33DMMの真値が入手できない状況において、単一顔モデルから生成された弱教師付きの3DMMパラメータが、マルチ顔データの学習にどの程度寄与するか?
  • RQ4検出と3DMM回帰を共同で訓練することで、別々に訓練する場合と比較して、検出精度と表情転送品質が向上するか?
  • RQ5提案手法は、複雑で制約のない環境下でも、モバイルデバイス上でリアルタイム性能を維持しながら高い精度を発揮できるか?

主な発見

  • 提案されたMFNは、AFWデータセットでmAP 98.8%を達成し、同じ設定下でHyperface(97.9%)とFaceness-Net(97.2%)を上回る性能を示した。
  • 検出とリターゲティングを統合したネットワークにより、1フレームあたりの推論時間が顔の数に関係なく39msにまで短縮され、キャスケード手法(1顔で49ms、10顔で184ms)を上回る性能を発揮した。
  • 検出とリターゲティングを1つのネットワークに統合することで、メモリフットプリントを13.5MB(別個の検出器+SFN)から13MBに削減した。
  • マルチスケールSFNは、目の表情の2Dランドマーク誤差が0.016、眉の怒りの表情では0.131を達成し、単一スケールSFN(0.082および0.331)を大きく上回り、分離性能の向上を実証した。
  • マルチスケールSFNの真値を用いて訓練されたMFNは、3D顔のモーションリターゲティング精度(NME: 0.229)において、SFN(0.229)と同等の性能を示したが、マルチ顔データで学習されているにもかかわらず。
  • 300VWおよびWIDERデータセットにおける可視化結果から、極端な表情やポーズに対しても、正確な3Dメッシュ再構築とバウンディングボックス予測が可能であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。