[論文レビュー] Identity Preserving Face Completion for Large Ocular Region Occlusion
本論文は、VR/ARヘッドセットによる大規模な被覆状態下でも本人の同一性を保つ顔の補完を実現する深層学習フレームワークを提案する。参照画像を用いて本人の同一性を強制し、ポーズマップとポーズ識別器を用いて、変化する頭部ポーズに対しても構造的一致性を維持する。本手法は、実データおよび合成データにおいて、従来手法に比べて顕著に優れた合成品質と頑健性を示す。
We present a novel deep learning approach to synthesize complete face images in the presence of large ocular region occlusions. This is motivated by recent surge of VR/AR displays that hinder face-to-face communications. Different from the state-of-the-art face inpainting methods that have no control over the synthesized content and can only handle frontal face pose, our approach can faithfully recover the missing content under various head poses while preserving the identity. At the core of our method is a novel generative network with dedicated constraints to regularize the synthesis process. To preserve the identity, our network takes an arbitrary occlusion-free image of the target identity to infer the missing content, and its high-level CNN features as an identity prior to regularize the searching space of generator. Since the input reference image may have a different pose, a pose map and a novel pose discriminator are further adopted to supervise the learning of implicit pose transformations. Our method is capable of generating coherent facial inpainting with consistent identity over videos with large variations of head motions. Experiments on both synthesized and real data demonstrate that our method greatly outperforms the state-of-the-art methods in terms of both synthesis quality and robustness.
研究の動機と目的
- VR/ARヘッドセットによる大規模な被覆状態下で、顔の補完を現実的に行う課題に対処すること。
- 非正面または変化する頭部ポーズ下でも失敗する、本人の同一性制御が不十分な従来の顔補完手法の限界を克服すること。
- 大規模な頭部運動を伴う動画シーケンスにおいて、一貫した本人の同一性保持とポーズ変動への対処を可能にすること。
- 参照画像とポーズの監視を活用して、現実的で一貫性のある顔の補完を導く生成フレームワークを開発すること。
提案手法
- 生成器の探索空間を正則化するため、ターゲットの本人の被覆なし画像から本人の特徴を抽出する参照ネットワークを導入する。
- 生成器の条件付けとポーズ一貫性のある顔構造の合成を支援するため、ポーズマップを入力として使用する。
- 予測されたポーズマップと真値のポーズマップを比較することで、不自然なポーズ変換をペナルティ化するポーズ識別器を採用する。
- 生成された画素と周囲の背景との文脈的一致性を強制するため、グローバル識別器を適用する。
- 知覚的損失、 adversarial 損失、本人保持損失を組み合わせたマルチ損失目的関数を用いて生成器を訓練する。
- 実世界での展開を想定し、合成データで事前学習したポーズ予測ネットワークを活用して、被覆された画像から頭部ポーズを推定する。
実験結果
リサーチクエスチョン
- RQ1大規模な被覆状態下でも、本人の同一性を保ちつつ高精細な顔補完を実現できるか。
- RQ2入力画像と異なるポーズ、照明、背景を持つ参照画像を使用した場合、本人の同一性をどのように制御できるか。
- RQ3動画シーケンスにおいて、変化する頭部ポーズに対しても一貫性のある顔構造を生成できるか。
- RQ4ポーズ識別器が、再構築された顔のポーズの現実性と正確性をどの程度向上させるか。
- RQ5大規模な頭部運動下において、本手法はSOTA手法と比較して、視覚的品質と頑健性の面でどの程度優れているか。
主な発見
- 本手法は、大規模な被覆状態下における実データおよび合成データにおいて、SOTAの顔補完手法に比べて顕著に優れた合成品質と頑健性を示す。
- 大規模な頭部ポーズ変動下でも、周囲の背景に自然に融合した高精細な顔の詳細を生成する。
- 1枚の参照画像を用いた一貫性のある結果から、動画シーケンスの各フレームにおいて本人の同一性が効果的に保持されていることが示された。
- ポーズ識別器により、高レベルのポージング誤差が著しく低減され、生成画像における顔の方向性がより現実的になった。
- HTC Vive VRヘッドセットを用いた実世界の動画シーケンスにおいて、先行手法と比較して、アーチファクトが少なく、より安定した結果が得られた。
- 影の影響を受けるマスク境界付近の一部のアーチファクトは依然として存在するが、LiらおよびIizukaらの手法と比較して、視覚的品質と一貫性において顕著な改善が見られた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。