Skip to main content
QUICK REVIEW

[論文レビュー] Mocycle-GAN: Unpaired Video-to-Video Translation

Chen Yang, Yingwei Pan|arXiv (Cornell University)|Aug 26, 2019
Generative Adversarial Networks and Image Synthesis参考文献 37被引用数 8
ひとこと要約

Mocycle-GAN は、動き推定を Cycle-GAN アーキテクチャに統合することで、外観の一貫性と時間的整合性を両立させる、未対応のビデオ間翻訳フレームワークを提案する。敵対的損失、フレームおよび動きのサイクル整合性、動き変換制約を導入することで、環境条件の移行や花の花びら移行といったタスクにおいて、現実的でフレアのないビデオ生成を達成し、未対応ビデオ翻訳分野で最先端の結果を実現した。

ABSTRACT

Unsupervised image-to-image translation is the task of translating an image from one domain to another in the absence of any paired training examples and tends to be more applicable to practical applications. Nevertheless, the extension of such synthesis from image-to-image to video-to-video is not trivial especially when capturing spatio-temporal structures in videos. The difficulty originates from the aspect that not only the visual appearance in each frame but also motion between consecutive frames should be realistic and consistent across transformation. This motivates us to explore both appearance structure and temporal continuity in video synthesis. In this paper, we present a new Motion-guided Cycle GAN, dubbed as Mocycle-GAN, that novelly integrates motion estimation into unpaired video translator. Technically, Mocycle-GAN capitalizes on three types of constrains: adversarial constraint discriminating between synthetic and real frame, cycle consistency encouraging an inverse translation on both frame and motion, and motion translation validating the transfer of motion between consecutive frames. Extensive experiments are conducted on video-to-labels and labels-to-video translation, and superior results are reported when comparing to state-of-the-art methods. More remarkably, we qualitatively demonstrate our Mocycle-GAN for both flower-to-flower and ambient condition transfer.

研究の動機と目的

  • 対応するトレーニングデータが利用できない未対応のビデオ間翻訳の課題に対処すること。
  • ビデオにフレーム単位の画像翻訳を適用した際に生じる時間的不連続性やフレアアーチファクトを克服すること。
  • ドメイン間における外観構造と動きダイナミクスを同時にモデル化することで、ビデオ生成を向上させること。
  • 時間的整合性と現実性の向上を図るため、動き誘導型の制約を導入すること。
  • 対応例が不要な、環境条件の移行や花の花びら間の翻訳といった多様なビデオ翻訳タスクを可能にすること。

提案手法

  • 連続するフレーム間の時間的ダイナミクスをモデル化するため、光流を用いた動き推定を統合する。
  • 生成されたフレームの外観が、元のドメインおよびターゲットドメインの両方で現実的であることを保証するため、敵対的損失を適用する。
  • フレームレベルおよび動きレベルのサイクル整合性を強制する:ドメイン X から Y にビデオを翻訳し、再び戻すと元のビデオが再構築されるべきである。
  • ソースドメインからターゲットドメインへの動きパターン(光流)を転送するための動き変換ネットワークを導入する。
  • 外観と動きの再構築をドメイン間で同時に制約する、二重サイクル整合性損失を採用する。
  • 残差 U-Net 生成器を用いた GAN 基盤の敵対的学習スキームで、すべての制約をエンドツーエンドで統合する。

実験結果

リサーチクエスチョン

  • RQ1フレーム単位の画像翻訳と比較して、動き推定は未対応ビデオ間翻訳における時間的整合性を向上させるか?
  • RQ2対応データが存在しない状況下でも、動きサイクル整合性は動きダイナミクスの維持にどの程度効果的か?
  • RQ3ドメイン間での明示的な動き変換は、生成ビデオの現実性と整合性を向上させるか?
  • RQ4Mocycle-GAN は、環境条件の移行や花の花びら間翻訳といった多様なビデオ翻訳タスクに一般化可能か?
  • RQ5Mocycle-GAN は、Cycle-GAN や Recycle-GAN といった最先端のベースラインと比較して、定量的および定性的にどの程度優れているか?

主な発見

  • Mocycle-GAN は、ビデオからラベル、ラベルからビデオへの翻訳において、定量的および定性的な両評価で最先端の手法を上回る優れた性能を達成した。
  • 人間評価では、花の花びら間翻訳で 77.5%、環境条件の移行で 82.5% の好まれるスコアを達成し、Cycle-GAN や Recycle-GAN を顕著に上回った。
  • 動き変換ネットワークは、ソースドメインからターゲットドメインへの光流の転送に成功しており、生成された光流がターゲット動画の真値に非常に近い結果を示した。
  • 定性的な結果から、特に昼から夜への変換や花の開花シーケンスの翻訳において、フレアのない時間的整合性の高いビデオが生成されていることが明らかになった。
  • アブレーションスタディの結果、高品質なビデオ生成には、動きサイクル整合性と動き変換の両方が不可欠であることが確認された。
  • Viper データセットにおいて、Mocycle-GAN は、より明るく自然な外見の昼間のビデオを生成したのに対し、ベースライン手法は退色し、現実性に欠ける出力を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。