Skip to main content
QUICK REVIEW

[論文レビュー] One-Shot Free-View Neural Talking-Head Synthesis for Video Conferencing

Ting-Chun Wang, Arun Mallya|arXiv (Cornell University)|Nov 30, 2020
Advanced Vision and Imaging参考文献 97被引用数 22
ひとこと要約

本論文は、1枚のソース画像とドライブビデオから高品質なトーキングヘッド動画を生成するワンショットニューラルトーキングヘッドビデオ合成モデルを提案する。新規の自己教師付き3次元キーポイント表現を用い、顔の識別情報と動きを分離することで、自由視点合成を可能にし、H.264と比較して10倍の帯域幅削減を達成しながら、CRF 36のH.264と同等の視覚的品質を維持する。また、動的視点回転と適応的キーポイント圧縮をサポートし、ビデオ会議に適した仕組みを実現する。

ABSTRACT

We propose a neural talking-head video synthesis model and demonstrate its application to video conferencing. Our model learns to synthesize a talking-head video using a source image containing the target person's appearance and a driving video that dictates the motion in the output. Our motion is encoded based on a novel keypoint representation, where the identity-specific and motion-related information is decomposed unsupervisedly. Extensive experimental validation shows that our model outperforms competing methods on benchmark datasets. Moreover, our compact keypoint representation enables a video conferencing system that achieves the same visual quality as the commercial H.264 standard while only using one-tenth of the bandwidth. Besides, we show our keypoint representation allows the user to rotate the head during synthesis, which is useful for simulating face-to-face video conferencing experiences.

研究の動機と目的

  • 2次元ベースのワンショットトーキングヘッド合成における固定視点制限を解消し、3次元グラフィックスモデルを必要とせずに局所的な自由視点合成を可能にすること。
  • 顔の識別に特化した外見と動き関連のダイナミクスを分離する、コンactな自己教師付き3次元キーポイント表現の開発。
  • キーポイント表現と残差を送信するだけで、H.264と比較して10倍のデータ使用量削減を実現する帯域効率の高いビデオ会議の実現。
  • 合成中に動的視点操作(例:頭部の回転)を可能にし、対面式ビデオ会議を模擬すること。
  • 変動するネットワーク状態に応じて、キーポイントメタデータと残差を適応的かつバイナリ符号化する方式を設計し、さらに帯域幅を削減すること。

提案手法

  • 動画シーケンスから自己教師付きで新規の3次元キーポイント表現を学習し、顔の識別情報と動きを別々の成分に分解する。
  • 深層ニューラルネットワークを用いて、ソース画像の外見と3次元キーポイントにエンコードされた動きの手がかりを組み合わせ、トーキングヘッド動画を合成する。
  • 推論時に3次元変換(回転、平行移動、変形)をキーポイント表現に適用し、新規の視点を生成する。
  • 動画の複雑さに応じてキーポイント数を動的に削減する適応的キーポイント方式を実装し、帯域幅の適応を可能にする。
  • 再構成フレームと真値の間の残差に対して、算術符号化を用いたバイナリ潜在符号化方式を適用し、送信コストを低減する。
  • ソース画像の品質が低下した場合にのみ残差符号化を統合することで、常に再送信を行わずとも再構成精度を向上させる。

実験結果

リサーチクエスチョン

  • RQ13次元顔モデルを明示的に使用せずに、ワンショットニューラルトーキングヘッドモデルが自由視点合成を達成できるか?
  • RQ2自己教師付き3次元キーポイント表現が、高精度な動画合成のための顔の識別と動きを効果的に分離できるか?
  • RQ3提案されたキーポイント表現は、視覚的品質を維持しつつ、ビデオ会議における帯域幅をどの程度削減できるか?
  • RQ4適応的キーポイントおよび残差符号化方式は、変動するネットワーク状態下で帯域幅効率をどの程度向上できるか?
  • RQ5本手法は、特にリアルタイム会議環境において、顕著に低いビットレートでH.264と同等またはそれ以上の視覚的品質を達成できるか?

主な発見

  • 提案手法は、ベンチマークデータセット上でH.264のCRF 36と同等の視覚的品質を達成し、帯域幅使用量を10倍削減した。
  • キーポイント表現に3次元変換を適用することで、頭部の回転や新規視点レンダリングが可能な局所的自由視点合成を実現した。
  • 適応的キーポイント方式により、1フレームあたりのメタデータサイズを53.03バイト(1ピクセルあたり0.001618ビット)にまで削減し、帯域効率の高い送信を可能にした。
  • 残差のバイナリ符号化により、平均して1回の更新あたり13.40 KBの送信量に抑えられ、ソース画像品質が低下した場合の再送信オーバーヘッドを顕著に低減した。
  • MTurkを用いたユーザースタディの結果、本手法はCRF 36のH.264およびCRF 37のH.265よりも好まれており、より低いビットレートでも同等または優れた知覚的品質を示した。
  • ベンチマークデータセット上での動画再構成、動き伝達、顔の再方向付けタスクにおいて、最先端のワンショットトーキングヘッド合成モデルを上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。