[論文レビュー] PIRenderer: Controllable Portrait Image Generation via Semantic Neural Rendering
PIRendererは、顔の表情、頭の向き、並進を制御する3次元可変顔モデル(3DMM)パラメータを用いて、直感的で写真のようにリアルなポートレート画像生成を可能にするニューラルレンダリングモデルです。分離されたモーション記述子と3部構成のネットワーク(マッピング、ワーピング、編集)を用い、高精細な画像および動画生成を実現し、直接編集および音声駆動型顔の再現タスクにおいて、最先端の手法を上回る性能を発揮します。リアルさとアイデンティティの保持が向上しています。
Generating portrait images by controlling the motions of existing faces is an important task of great consequence to social media industries. For easy use and intuitive control, semantically meaningful and fully disentangled parameters should be used as modifications. However, many existing techniques do not provide such fine-grained controls or use indirect editing methods i.e. mimic motions of other individuals. In this paper, a Portrait Image Neural Renderer (PIRenderer) is proposed to control the face motions with the parameters of three-dimensional morphable face models (3DMMs). The proposed model can generate photo-realistic portrait images with accurate movements according to intuitive modifications. Experiments on both direct and indirect editing tasks demonstrate the superiority of this model. Meanwhile, we further extend this model to tackle the audio-driven facial reenactment task by extracting sequential motions from audio inputs. We show that our model can generate coherent videos with convincing movements from only a single reference image and a driving audio stream. Our source code is available at https://github.com/RenYurui/PIRender.
研究の動機と目的
- 顔の表情、頭の向き、並進のための分離された3DMMパラメータを用いて、直感的で意味論的なレベルの制御によるポートレート画像生成を可能にすること。
- キーポイントやエッジのような間接的で空間的に制限されたモーション記述子に依存する従来の手法の限界を解決すること。
- 多様なモーション条件下でも顕著なアイデンティティ保持を実現する高精細なポートレート編集を達成すること。
- 音声入力から一貫性があり表現力のあるモーションを抽出することで、音声駆動型顔の再現にモデルを拡張すること。
- 仮想アバターおよびソーシャルメディアアプリケーションへの応用を想定し、効率的なニューラルレンダラーとしての汎用性を示すこと。
提案手法
- モデルは、3DMMパラメータを潜在ベクトルに変換するマッピングネットワークを用い、顔の動きを誘導する。
- ワーピングネットワークは、潜在ベクトルから変形フィールドを推定し、それを元にソース画像を変形して粗い結果を得る。
- 編集ネットワークは、変形された画像を精緻に修正し、高精細な詳細を備えた写真のようにリアルな出力を生成する。
- モデルは完全に分離された3DMMパラメータをモーション記述子として用いることで、被写体に依存しない意味論的な制御を可能にする。
- 音声駆動型再現のため、学習関数$f_\theta$を用いて音声から逐次的なモーション係数を抽出し、多様でリアルなモーション生成を実現する。
- 敵対的損失および知覚的損失を用いて、エンド・トゥ・エンドでモデルを訓練することで、リアルさとモーションの正確さを確保する。

実験結果
リサーチクエスチョン
- RQ1完全に分離された3DMMパラメータを制御信号として用いるニューラルレンダラーは、写真のようにリアルなポートレート画像を生成できるか?
- RQ2他の人物の動画からのモーション模倣において、元のアイデンティティはどの程度保持されるか?
- RQ3音声入力のみから一貫性があり表現力のある顔の動きシーケンスを生成できるか?
- RQ4キーポイントのような空間的に制限された記述子と比較して、意味論的で分離されたモーション記述子を用いることで性能が向上するか?
- RQ5モデルはアイデンティティを越えて一般化でき、直接的および間接的な編集シナリオの両方でリアルな結果を生成できるか?
主な発見
- MTurk評価においてPIRendererは最高のだまし成功率を達成—同一アイデンティティ再構築で86.5%、クロスアイデンティティ模倣で78.5%—、優れたリアルさを示している。
- 定量的指標において、PIRendererはFOMM、GFLA、X2Faceを含む最先端の手法を、再構築およびモーション模倣の両タスクで上回っている。
- モデルは音声入力からの正確な口唇運動、微細な表情(例:瞬き、ふんわりと唇を動かす)および自然な頭の向きを生成するが、DAVSは非口唇の動きを生成できない。
- 定性的な結果では、大きなポーズ変化や表情変化に対しても、ワーピングアーティファクト、過剰な平滑化、アイデンティティの劣化が見られない。
- モデルは1つの音声ストリームから任意のターゲットアイデンティティにモーションを転送でき、多様で鮮やかな顔の動きシーケンスを生成する。
- 完全に分離された3DMMパラメータの使用により、被写体に依存しないモーション抽出が可能となり、再トレーニングなしに異なる顔のソースに対して一般化できる。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。