Skip to main content
QUICK REVIEW

[論文レビュー] Real-Time Facial Segmentation and Performance Capture from RGB Input

Shunsuke Saito, Tianye Li|arXiv (Cornell University)|Apr 10, 2016
Face recognition and analysis参考文献 19被引用数 22
ひとこと要約

本稿では、極度の遮蔽下でも正確で頑健な顔領域分離とパフォーマンスキャプチャを実現する、リアルタイムでRGBベースの顔領域分離システムを提示する。2本のストリームを持つ逆畳み込みニューラルネットワークを用い、共通の畳み込み特徴を活用することで、顔領域の正確な分離を達成している。合成された手による遮蔽や顔以外の領域をマスクするデータ拡張手法を用いて訓練することで、30 fpsで最先端の3D顔追跡が可能となり、完全な手による顔への接触や側面視点でも顔の追跡が安定する。従来のRGBオンリーメソッドと比較して、著しく高い頑健性を示している。

ABSTRACT

We introduce the concept of unconstrained real-time 3D facial performance capture through explicit semantic segmentation in the RGB input. To ensure robustness, cutting edge supervised learning approaches rely on large training datasets of face images captured in the wild. While impressive tracking quality has been demonstrated for faces that are largely visible, any occlusion due to hair, accessories, or hand-to-face gestures would result in significant visual artifacts and loss of tracking accuracy. The modeling of occlusions has been mostly avoided due to its immense space of appearance variability. To address this curse of high dimensionality, we perform tracking in unconstrained images assuming non-face regions can be fully masked out. Along with recent breakthroughs in deep learning, we demonstrate that pixel-level facial segmentation is possible in real-time by repurposing convolutional neural networks designed originally for general semantic segmentation. We develop an efficient architecture based on a two-stream deconvolution network with complementary characteristics, and introduce carefully designed training samples and data augmentation strategies for improved segmentation accuracy and robustness. We adopt a state-of-the-art regression-based facial tracking framework with segmented face images as training, and demonstrate accurate and uninterrupted facial performance capture in the presence of extreme occlusion and even side views. Furthermore, the resulting segmentation can be directly used to composite partial 3D face models on the input images and enable seamless facial manipulation tasks, such as virtual make-up or face replacement.

研究の動機と目的

  • 制約のないRGB入力から、極度の遮蔽下でもリアルタイムで頑健な3次元顔パフォーマンスキャプチャを可能にすること。
  • 髪、手、装飾品などの遮蔽によって引き起こされる高次元の外観変動の課題に対処すること。
  • 顔領域を明示的に分離し、マスクされた顔データで3次元レグレッサーを訓練することで、追跡精度を向上させること。
  • 一般化性能を向上させるために、合成遮蔽とネガティブサンプルを含むデータ拡張戦略を開発すること。
  • 意味的分離により、顔モデリングの次元を低減させ、より安定的で正確な回帰を可能にすること。

提案手法

  • 共通の低レベル畳み込み特徴を有する2ストリーム逆畳み込みネットワークを用い、同時に粗い顔形状と詳細な境界情報を予測する。
  • ネットワークは確率マップを出力し、グラフカットアルゴリズムを用いて精緻なセグメンテーションマスクに精錬される。
  • 事前学習済みImageNet特徴を活用し、LFWおよびFaceWarehouseデータセット上で、慎重に設計された訓練サンプルで微調整する。
  • 新規なデータ拡張戦略として、摂動、ランダムクロッピング、合成遮蔽(例:手)および顔のないネガティブサンプルを含む。
  • 最終的なセグメンテーションマスクを用いて顔領域を分離し、それを最先端のDDEベースの3次元顔追跡フレームワークに供給する。
  • システムは30 fpsでリアルタイムに動作し、GPUとCPUで並列にセグメンテーションと追跡処理が行われる。

実験結果

リサーチクエスチョン

  • RQ1制約のないRGB入力からのリアルタイムでピクセル単位の顔領域分離は、遮蔽下における3次元顔パフォーマンスキャプチャの頑健性を著しく向上させ得るか?
  • RQ2共通の畳み込み特徴を有する2ストリーム逆畳み込みアーキテクチャは、顔領域分離においてグローバル形状と詳細な境界を同時に捉えるのにどの程度有効か?
  • RQ3合成遮蔽データとネガティブサンプルは、データが限られた状況下で顔領域分離の一般化性能をどの程度向上させるか?
  • RQ4深層分離から得られるマスク付きトレーニングデータは、マスクなしトレーニングと比較して、極度の遮蔽下でも3次元顔回帰性能を向上させるか?
  • RQ5明示的な意味的分離は、3次元顔フィッティング問題の有効次元を低減させ、より安定的で正確な追跡を可能にするか?

主な発見

  • 提案手法は、CPUとGPUで並列に処理されるセグメンテーションと追跡処理により、RGB入力のみで30 fpsのリアルタイムパフォーマンスキャプチャを達成している。
  • 手が顔と同程度の肌色を持つ場合でも、完全な手による顔への接触時においても正確な追跡を維持しており、従来のRGBオンリーメソッドを上回っている。
  • データ拡張において合成遮蔽とネガティブサンプルを用いることで、限られた実際のセグメンテーションデータに対する過学習を著しく低減し、一般化性能が向上した。
  • 共通の畳み込み特徴を有する2ストリーム逆畳み込みアーキテクチャは、特に細かな境界の維持において最先端の顔領域分離精度を達成している。
  • RGB入力のみに依存しているにもかかわらず、最近のRGB-Dベースのアプローチ[7]と同等の遮蔽耐性を示している。
  • 得られたセグメンテーションマスクにより、髪や手などの遮蔽物がある状況下でも3次元顔モデルのシームレスな合成が可能となり、バーチャルメイクや顔置換などの応用が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。