[論文レビュー] EgoFace: Egocentric Face Performance Capture and Videorealistic Reenactment
EgoFaceは、眼鏡に取り付けられた単一のフィッシュアイカメラを用いて、軽量でリアルタイムなエゴセントリックな顔のパフォーマンスキャプチャとビデオリアリスティックなリアレンジメントを実現するシステムである。CNN(Ego2Exp)を用いて、極めて歪んだ片側からの視界から顔の表情を推定し、敵対的に訓練されたGAN(Exp2VRealFace)により、前面を向いた写真のようにリアルな動画を生成することで、手動のアノテーションやウェアラブルデバイスを必要とせず、変動する照明、背景、動きに対しても高精細な結果を達成している。
Face performance capture and reenactment techniques use multiple cameras and sensors, positioned at a distance from the face or mounted on heavy wearable devices. This limits their applications in mobile and outdoor environments. We present EgoFace, a radically new lightweight setup for face performance capture and front-view videorealistic reenactment using a single egocentric RGB camera. Our lightweight setup allows operations in uncontrolled environments, and lends itself to telepresence applications such as video-conferencing from dynamic environments. The input image is projected into a low dimensional latent space of the facial expression parameters. Through careful adversarial training of the parameter-space synthetic rendering, a videorealistic animation is produced. Our problem is challenging as the human visual system is sensitive to the smallest face irregularities that could occur in the final results. This sensitivity is even stronger for video results. Our solution is trained in a pre-processing stage, through a supervised manner without manual annotations. EgoFace captures a wide variety of facial expressions, including mouth movements and asymmetrical expressions. It works under varying illuminations, background, movements, handles people from different ethnicities and can operate in real time.
研究の動機と目的
- 単一のRGBカメラを用いて、動的で制御不能な環境において、モバイルで邪魔にならない顔のパフォーマンスキャプチャを可能にすること。
- 極めて歪んだ片側からのエゴセントリックな視界から正確な顔の表情を再構築する課題に対処すること。
- マルチカメラセットアップやウェアラブルデバイスを必要とせず、エゴセントリック入力から前面を向いた写真のようにリアルな動画のリアレンジメントを生成すること。
- テレビ会議やテレプレゼンス用途に適したリアルタイム性能を達成すること。
- 多様な人種、照明、動きに一般化するデータセットとトレーニングパイプラインの開発
提案手法
- 教師あり学習により、手動のアノテーションを必要とせず、単一のエゴセントリックRGB画像を低次元の潜在空間における顔の表情パラメータにマップするCNNベースのネットワークEgo2Exp。
- 条件付きGANであるExp2VRealFaceは、敵対的訓練を用いて再構築された3次元顔モデルを、顔の整合性とリアリズムを保った前面を向いた写真のようにリアルな動画に変換する。
- 個体固有のトレーニングを用いたパrametricな顔モデルを採用し、表情や視点が変わっても被写体の一貫性を維持する。
- Exp2VRealFaceのトレーニングターゲットとして、顔モデルの合成レンダリングを用い、エゴセントリック視点から前面視点への非ペaired画像変換を可能にする。
- ネットワークの深さと入力解像度の低減、時間的モデリングの削除により推論速度を最適化し、1フレームあたり36.2 msでリアルタイム動作を実現。
- 特にモバイルテレプレゼンス用途を想定し、入力および出力に対してタイトな顔クロップと解像度の128×128への低減を実施して効率を向上
実験結果
リサーチクエスチョン
- RQ1眼鏡に取り付けられた単一の極めて歪んだエゴセントリックカメラが、マルチカメラシステムと同等の正確な顔の表情推定を達成できるか?
- RQ2敵対的訓練により、手動のスーパービジョンを必要とせず、片側で斜めの視点からのリアリスティックな前面を向いた顔のリアレンジメントを生成できるか?
- RQ3多様な照明条件、背景、顔の表情(非対称的で複雑な口の動きも含む)にわたって、このシステムはどれほど一般化できるか?
- RQ4このパイプラインは、消費者用ハードウェアでもリアルタイムで動作するか?テレプレゼンスやビデオ会議用途に適しているか?
- RQ5CycleGAN や UNIT といった非ペアド画像変換手法に比べ、顔の構造と表情の忠実度をどれほど良く保てるか?
主な発見
- EgoFaceは、単一の斜めのエゴセントリック視点のみを用いても、最先端の前面視点手法と同等の顔の幾何学的推定精度(平均誤差1.7 mm)を達成している。
- 敵対的に訓練されたExp2VRealFaceネットワークは、顔のアイデンティティと表情を保持した写真のようにリアルな前面視点のリアレンジメントを生成し、CycleGAN や UNIT より優れた性能を示しており、不自然な顔の変形を引き起こさない。
- 最適化されたEgoFaceパイプラインは、ResNet50と軽量なExp2VRealFaceを用いて1フレームあたり36.2 msで動作し、テレプレゼンス用途に適したリアルタイム性能を達成している。
- Ego2ExpのVGGバックボーンをResNet50に置き換えることで、推論時間を54%短縮(26.4 ms → 11.5 ms)し、精度の損失は最小限に抑えられた。
- Exp2VRealFaceの完全版と最適化版の間で、自己リアレンジメントの平均二乗誤差(MSE)に顕著な差がなく、最適化が視覚的品質を低下させないことを確認した。
- 本システムは、人種の多様性、変動する照明、複雑な表情、動的な背景に対しても、性能の劣化なく対応できている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。