Skip to main content
QUICK REVIEW

[論文レビュー] Task-agnostic Temporally Consistent Facial Video Editing

Meng Cao, Haozhi Huang|arXiv (Cornell University)|Jul 3, 2020
Face recognition and analysis参考文献 37被引用数 5
ひとこと要約

本稿では、3次元可塑的モデルと新規の3次元時間損失を活用して、顔の交換と再現を統合する、タスクに依存しない時間的に一貫性のある顔映像編集フレームワークであるTFVGANを提案する。動的トレーニングサンプル選択とディープブレンドネットワークを組み合わせることで、多様な編集タスクにおいて高精細でフレアフリーの動画生成を実現し、時間的一致性と現実性の面で最先端の性能を達成する。

ABSTRACT

Recent research has witnessed the advances in facial image editing tasks. For video editing, however, previous methods either simply apply transformations frame by frame or utilize multiple frames in a concatenated or iterative fashion, which leads to noticeable visual flickers. In addition, these methods are confined to dealing with one specific task at a time without any extensibility. In this paper, we propose a task-agnostic temporally consistent facial video editing framework. Based on a 3D reconstruction model, our framework is designed to handle several editing tasks in a more unified and disentangled manner. The core design includes a dynamic training sample selection mechanism and a novel 3D temporal loss constraint that fully exploits both image and video datasets and enforces temporal consistency. Compared with the state-of-the-art facial image editing methods, our framework generates video portraits that are more photo-realistic and temporally smooth.

研究の動機と目的

  • フレームごとまたは連結フレーム手法に見られるような、視覚的フレア(ちらつき)を引き起こす時間的一致性の欠如を解消する。
  • 顔の交換と再現といった複数の顔映像編集タスクを、タスク固有の再訓練を必要としない、統一的かつ拡張可能なフレームワークに統合する。
  • 3次元顔再構成を活用することで、アイデンティティ、ポーズ、表情の分離可能な操作を可能にし、より自由な編集を実現する。
  • 動的トレーニングサンプル選択メカニズムを用いて画像データセットと動画データセットを統合することで、トレーニング効率と忠実度を向上させる。
  • 密なオプティカルフローと重心座標補間を基にした新規の3次元時間損失を用いて、連続するフレーム間の一貫性を強制する。

提案手法

  • 3次元可塑的モデル(3DMM)を用いて、顔画像をアイデンティティ、ポーズ、表情の係数に分離し、統一的な操作を可能にする。
  • トレーニング中に画像データセットと動画データセットを交互に切り替える動的トレーニングサンプル選択メカニズムを導入し、多様性と時間的監視のバランスを取る。
  • 密なオプティカルフローを用いた重心座標補間により、新規の3次元時間損失を設計し、連続フレーム間の一貫性を強制する。
  • ラスタライゼーションレンダラを用いて、分離された3次元係数を再結合し、変換された顔のシーケンスを生成する。
  • レンダリングされた顔を補助的な外観ヒントとディープブレンドネットワークで統合し、写真的にリアルな出力を得る。
  • 画像と動画データセットの混合を用いた敵対的訓練により、忠実度と一貫性の両方を共同最適化する。

実験結果

リサーチクエスチョン

  • RQ1統一されたフレームワークは、顔の交換や再現といった複数の顔映像編集タスクを、タスク固有の設計を必要とせずに処理できるか?
  • RQ2フレームレベルの変換が適用される場合でも、特にちらつきを解消するために、時間的一致性を明示的に強制する方法は何か?
  • RQ3画像と動画データセットを混合してトレーニングすることで、分離したトレーニングに比べて忠実度と時間的一致性がどの程度向上するか?
  • RQ43次元顔再構成は、2次元ランドマークベースの手法を上回る、アイデンティティ、ポーズ、表情の分離可能な操作を可能にするか?
  • RQ5提案された3次元時間損失は、フレーム間の光度誤差を低減し、視覚的な滑らかさを向上させるのにどの程度効果的か?

主な発見

  • 顔再現タスクにおいて、VoxCeleb2データセットでFIDが24.4を達成し、ブレンドネットワークをAdaINに置き換えたベースライン(36.9)を著しく上回る。
  • アブレーションスタディの結果、3次元時間損失を削除すると、時間的誤差 $E_{\text{tmp}}$ が3.65から4.69に上昇し、その一貫性への重要性が確認された。
  • 動的トレーニングサンプル選択メカニズムにより、動画データのみでトレーニングした場合に比べ、時間的誤差が12.5%低減され、一般化性能の向上が示された。
  • バッチスタイル正規化(BSN)層の導入により、視覚的調和と文脈の一貫性が向上し、AdaINに比べて光度誤差が15%低減された。
  • 顔交換では時間的誤差 $E_{\text{tmp}}$ が3.54、再現では3.65を記録し、時間的一致性の面で最先端の手法を上回った。
  • 可視化結果から、3次元時間損失が特に大きなポーズ変化下でもちらつきを効果的に低減していることが確認され、損失有無の詳細な比較で明確に示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。