[論文レビュー] FLNet: Landmark Driven Fetching and Learning Network for Faithful Talking Facial Animation Synthesis
FLNetは、ランドマーク付きの5枚のソース画像を用いて、ワーピングベースのフェッチストリームとアピアランスベースの学習ストリームを融合することで、忠実な会話顔アニメーションを合成するランドマーク駆動型二重ストリームネットワークを提案する。この手法は、特に歯や目といった細かな顔面ディテールが単一画像ベースラインでしばしば失われるのを防ぐことにより、優れた定量的・定性的な結果を達成する。
Talking face synthesis has been widely studied in either appearance-based or warping-based methods. Previous works mostly utilize single face image as a source, and generate novel facial animations by merging other person's facial features. However, some facial regions like eyes or teeth, which may be hidden in the source image, can not be synthesized faithfully and stably. In this paper, We present a landmark driven two-stream network to generate faithful talking facial animation, in which more facial details are created, preserved and transferred from multiple source images instead of a single one. Specifically, we propose a network consisting of a learning and fetching stream. The fetching sub-net directly learns to attentively warp and merge facial regions from five source images of distinctive landmarks, while the learning pipeline renders facial organs from the training face space to compensate. Compared to baseline algorithms, extensive experiments demonstrate that the proposed method achieves a higher performance both quantitatively and qualitatively. Codes are at https://github.com/kgu3/FLNet_AAAI2020.
研究の動機と目的
- 歯や目といった隠れたまたは複雑な顔面ディテールを忠実に合成できない単一画像ベースの手法の限界を解消すること。
- 顔の特徴点が異なる複数枚のソース画像を活用することで、顔アニメーションの忠実性を向上させること。
- ワーピングベースの特徴フェッチとアピアランスベースの特徴学習を組み合わせ、強固でアイデンティティを保持する顔アニメーションを実現すること。
- 後処理を排除し、エンドツーエンドで高品質でリアルな顔アニメーションを生成すること。
提案手法
- ネットワークは二重ストリームアーキテクチャを採用:ワーピングベースのフェッチストリームとアピアランスベースの学習ストリーム。
- フェッチストリームは、ランドマークアラインメントに基づいて、5枚のソース画像から顔領域を注意メカニズムを用いて選択・ワープ・統合する。
- 学習ストリームは、トレーニングフェーススペースからの顔の外見特徴を学習し、見えないまたは欠落したディテールを補完する。
- 両ストリームの出力を統合して最終的な顔画像を生成し、アイデンティティの一貫性とディテールの忠実性を保証する。
- 複数画像のソースバンクにより、モデルは多様な顔面ジオメトリにアクセスでき、遮蔽されたまたは複雑な領域の合成を向上させる。
- 生成のリアルネスと構造的正確性を向上させるために、敵対的損失と知覚的損失を用いてエンドツーエンドで訓練する。
実験結果
リサーチクエスチョン
- RQ1異なるランドマークを持つ複数枚のソース画像を用いることで、歯や目のような細かな顔面ディテールの合成が向上するか?
- RQ2ワーピングベースのフェッチとアピアランスベースの学習の組み合わせが、顔アニメーションの忠実性をどのように向上させるか?
- RQ3ソース画像バンクのサイズが、生成された顔アニメーションの品質に与える影響は何か?
- RQ4提案手法は、アイデンティティとディテールの保持において、単一画像ベースラインを上回るか?
- RQ5注意ベースの領域選択メカニズムは、遮蔽されたまたは見えない顔面ジオメトリに対処するためにどれほど効果的か?
主な発見
- 5枚のソース画像を用いた完全なFLNetモデルは、FIDスコア(12.8)とLPIPS値(0.15)が最高となり、単一画像ベースラインを著しく上回った。
- アブレーションスタディの結果、アピアランスベースのストリームのみを用いる場合、歯やしわのようなディテールがぼやけるのに対し、ワーピングストリームのみでは隠れた領域で失敗する。
- 3枚のソース画像を用いたモデルは単一画像入力よりも優れているが、依然として5枚のバンクバージョンに劣る性能を示した。
- 可視化結果から、注意マスクが動的に異なるソース画像から最適な領域を選択していることが確認され、たとえば1枚の画像から閉じた目、別の画像から開いた口を選択している。
- インターデンタル子音では、ランドマーク構成の曖昧さにより失敗ケースが発生し、音声支援による精錬の必要性が示唆された。
- 本手法は後処理を一切行わず、質的および定量的評価の両面で、強固でリアルなアニメーションを生成できることを示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。