[論文レビュー] X2Face: A network for controlling face generation by using images, audio, and pose codes
X2Faceは、ラベルなしで、画像、音声、またはポーズコードを使って顔生成を制御する自己教師ありニューラルネットワークを提案する。動画データからアイデンティティに依存しない埋め込み顔表現を学習し、別の顔、音声、またはポーズコードからのドライブ信号を使ってソース顔をアニメーション化する。ゼロショットモダリティ転送を実現し、頑健で制御可能で多用途な顔アニメーションを達成する。
The objective of this paper is a neural network model that controls the pose and expression of a given face, using another face or modality (e.g. audio). This model can then be used for lightweight, sophisticated video and image editing. We make the following three contributions. First, we introduce a network, X2Face, that can control a source face (specified by one or more frames) using another face in a driving frame to produce a generated frame with the identity of the source frame but the pose and expression of the face in the driving frame. Second, we propose a method for training the network fully self-supervised using a large collection of video data. Third, we show that the generation process can be driven by other modalities, such as audio or pose codes, without any further training of the network. The generation results for driving a face with another face are compared to state-of-the-art self-supervised/supervised methods. We show that our approach is more robust than other methods, as it makes fewer assumptions about the input data. We also show examples of using our framework for video face editing.
研究の動機と目的
- ポーズ、表情、アイデンティティのアノテーションを一切必要とせず、動画データのみを使って顔生成を制御する自己教師ありフレームワークの開発。
- ドライブフレームからのポーズと表情を転送することで、ソース顔のアイデンティティを保持したまま制御可能な顔アニメーションの実現。
- 再トレーニングなしで、音声やポーズコードなどの非視覚的モダリティによって駆動できるフレームワークへの拡張。
- 学習済み埋め込み顔表現を、直接操作可能な安定したアイデンティティに依存しないテクスチャマップとして用いることで、動画編集を可能にする。
- 入力データに制限を設けず、実世界の制約のない動画データにおいても頑健で汎用性の高い性能を示す。
提案手法
- ソース顔を分離・アイデンティティ保持可能な表現にエンコードする埋め込みネットワークと、この表現から生成フレームをマッピングするドライブネットワークを備えた二本のブランチネットワークを訓練。
- ソースフレームとドライブフレームのペアに対して自己教師ありコントラスト学習を実施し、ラベルなしで分離可能な表現を学習。
- ソースにおけるポーズや表情の変化に対して、埋め込みネットワークが不変であるように制約を課すことにより、アイデンティティとモーション/ポーズ/表情を分離。
- ドライブフレームを、埋め込みソース顔とドライブフレームから導出されるドライブベクトルから再構成できるようにドライブネットワークを訓練。
- トレーニング後、音声特徴やポーズコードからドライブベクトル空間への線形射影を学習することで、モダリティ転送を可能にする。
- 埋め込み顔をUVテクスチャマップとして用い、直接編集してドライブフレームのシーケンスに再適用することで動画編集を実現。
実験結果
リサーチクエスチョン
- RQ1自己教師ありニューラルネットワークは、アノテーションなしで制約のない動画データから、分離可能でアイデンティティを保持する顔表現を学習できるか?
- RQ2同じトレーニング済みネットワークが、ドライブフレームからのポーズと表情を転送することで、アイデンティティが未知の顔に対してもリアルな顔アニメーションを生成できるか?
- RQ3再トレーニングなしで、音声やポーズコードなどの非視覚的モダリティによってネットワークを効果的に駆動できるか?
- RQ4埋め込み顔表現が、顔の装飾追加などの動画編集タスクの安定した基盤としてどの程度活用できるか?
- RQ5教師ありおよび自己教師ありの最先端手法と比較して、本手法の頑健性と品質はどの程度か?
主な発見
- X2Faceは、トレーニング時にポーズ、表情、アイデンティティのアノテーションを一切必要とせず、多様なアイデンティティとポーズにおいて頑健な顔アニメーションを実現した。
- 音声入力によっても顔アニメーションが成功しており、話された音声に一致する口唇運動を生成した—たとえ音声が別の話者から来ていたり、ソース動画とは関係がなくても同様に動作した。
- 埋め込み顔表現はポーズや表情にかかわらず安定しており、直接埋め込み顔を編集することで一貫性のある動画編集が可能になった。
- 同じ修正済み埋め込み顔を用いることで、プロファイルと正面の両方のビューで一貫したタトゥーや傷のレンダリングが可能であることが実証された。
- 特に制約のないまたは未知のアイデンティティに対しても、自己教師ありおよび教師ありの最先端手法を上回る頑健性を示した。
- 生成品質は特化した顔交換モデルに比べてわずかに劣るが、包括性、自己教師あり性、制御可能性のバランスに優れている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。