Skip to main content
QUICK REVIEW

[論文レビュー] Few-shot Video-to-Video Synthesis

Ting-Chun Wang, Ming-Yu Liu|arXiv (Cornell University)|Oct 28, 2019
Advanced Vision and Imaging参考文献 64被引用数 8
ひとこと要約

本論文は、1枚の参照画像から学習された自己適応的畳み込み重みを用いて高品質な動画フレームを生成する少数ショット動画から動画への変換手法を提案する。層間で特徴を再利用し、複数の例画像を統合するための注目メカニズムを採用することで、被験者ごとの大量の訓練を要しないにもかかわらず、推論時間も最小限に抑えられ、vid2vid や Zhou ら(2019)のような手法を凌駕する最先端の結果を達成する。

ABSTRACT

Video-to-video synthesis (vid2vid) aims at converting an input semantic video, such as videos of human poses or segmentation masks, to an output photorealistic video. While the state-of-the-art of vid2vid has advanced significantly, existing approaches share two major limitations. First, they are data-hungry. Numerous images of a target human subject or a scene are required for training. Second, a learned model has limited generalization capability. A pose-to-human vid2vid model can only synthesize poses of the single person in the training set. It does not generalize to other humans that are not in the training set. To address the limitations, we propose a few-shot vid2vid framework, which learns to synthesize videos of previously unseen subjects or scenes by leveraging few example images of the target at test time. Our model achieves this few-shot generalization capability via a novel network weight generation module utilizing an attention mechanism. We conduct extensive experimental validations with comparisons to strong baselines using several large-scale video datasets including human-dancing videos, talking-head videos, and street-scene videos. The experimental results verify the effectiveness of the proposed framework in addressing the two limitations of existing vid2vid approaches.

研究の動機と目的

  • 被験者ごとの大規模なトレーニングに依存しない、1枚の参照画像のみを用いた高精細な動画から動画への変換を可能にすること。
  • vid2vid や Zhou ら(2019)のような、被験者ごとに大量のトレーニングデータと時間が必要な従来手法の限界を克服すること。
  • 1枚の例画像から自己適応的に畳み込み重みを生成できる汎用的で高速な推論フレームワークを開発すること。
  • 特徴の再利用と注目メカニズムによる空間的に適応的な動的畳み込みカーネルの学習により、合成の視覚的品質と多様性を向上させること。

提案手法

  • SPADE生成器を変更し、前の層からの特徴を再利用してアフィンパラメータを生成することで、層間の特徴の一貫性を向上させる。
  • 学習可能な重み生成メカニズムを導入し、参照画像からの特徴を適応的プーリング(AdaPool)でエンコードし、全結合層を通じて畳み込みカーネル重みを生成する。
  • 複数の例画像からの特徴を統合するために注目メカニズムを導入し、各出力位置に対してどの例画像のどの空間的位置が最も寄与するかを学習するソフトな空間マップを生成する。
  • 生成された重みをSPADE層で使用し、空間的に適応的な正規化パラメータを生成することで、コンテンツに応じた特徴変調を可能にする。
  • AdaINを拡張し、より大きなカーネルサイズとグループ正規化を許容することで、表現力と柔軟性を向上させる。
  • モデルはエンドツーエンドで訓練され、1枚の例画像を用いてほぼリアルタイムでの推論が可能である。

実験結果

リサーチクエスチョン

  • RQ1被験者ごとの微調整を要せず、1枚の参照画像のみで効果的な動画から動画への変換が可能かどうか。
  • RQ2固定正規化手法(例:AdaIN)と比較して、自己適応的重み生成は視覚的品質と表現力においてどのように優れているか。
  • RQ3複数の例画像を統合する注目メカニズムは、合成品質と一般化性能をどの程度向上させるか。
  • RQ4データセットサイズが増加する際のスケーリング特性は何か。また、トレーニングデータが増加しても性能が維持されるか。
  • RQ5トレーニングドメインとは著しく異なるドメイン(例:CGキャラクター)に対して、本手法はゼロショットで一般化可能か。

主な発見

  • 1枚の例画像のみを用いても、vid2vid や他のベースラインと同等またはそれ以上の視覚的品質を達成し、強力な少数ショット一般化性能を示す。
  • 追加の例画像で微調整した場合、ベースライン手法を上回る性能を示し、高い適応性を示す。
  • 注目メカニズムにより、例えば前面と背面のビューを組み合わせて関連する身体部位に注目できるようになり、合成品質が顕著に向上する。
  • AdaINよりも提案手法の重み生成方式が優れているのは、データセットサイズが増加するにつれて顕著であり、表現力が高く、より大きな畳み込みカーネルを生成できるからである。
  • 人間評価では、60,000件の評価に基づき0.5をはるかに上回るスコアが得られ、本手法の知覚的品質の優位性が確認された。
  • CGキャラクターのようにトレーニングデータとは著しく異なるドメインでは失敗するため、ゼロショットのドメイン一般化に限界があることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。