Skip to main content
QUICK REVIEW

[論文レビュー] Free-form Video Inpainting with 3D Gated Convolution and Temporal PatchGAN

Ya-Liang Chang, Zhe Yu Liu|arXiv (Cornell University)|Apr 23, 2019
Generative Adversarial Networks and Image Synthesis参考文献 34被引用数 10
ひとこと要約

本論文は、任意のマスク形状を扱える3次元ゲート付き畳み込みを用いて自由形式の動画補間を実現する学習ベースの手法を提案する。さらに、時間的整合性を確保するための新規な時間的PatchGAN損失を導入している。本手法は、FaceForensicsおよび新たに収集されたFVIデータセットの両方で最先端の結果を達成し、動画の品質と一貫性において従来手法を上回っている。

ABSTRACT

Free-form video inpainting is a very challenging task that could be widely used for video editing such as text removal. Existing patch-based methods could not handle non-repetitive structures such as faces, while directly applying image-based inpainting models to videos will result in temporal inconsistency (see http://bit.ly/2Fu1n6b ). In this paper, we introduce a deep learn-ing based free-form video inpainting model, with proposed 3D gated convolutions to tackle the uncertainty of free-form masks and a novel Temporal PatchGAN loss to enhance temporal consistency. In addition, we collect videos and design a free-form mask generation algorithm to build the free-form video inpainting (FVI) dataset for training and evaluation of video inpainting models. We demonstrate the benefits of these components and experiments on both the FaceForensics and our FVI dataset suggest that our method is superior to existing ones. Related source code, full-resolution result videos and the FVI dataset could be found on Github https://github.com/amjltc295/Free-Form-Video-Inpainting .

研究の動機と目的

  • 自由形式の動画補間の課題に対処すること。特に、欠損領域が任意の形状をとり、従来の手法では時間的整合性を維持できない問題に焦点を当てる。
  • 繰り返しのない構造(例:顔)を扱う際に困難をきたすパッチベース手法の限界を克服すること。
  • 光流を用いず、画像補間モデルを動画に拡張することで、フレーム間のちらつきや時間的不整合を回避すること。
  • 自由形式の動画補間モデルの学習と評価のための新しいデータセットとマスク生成アルゴリズムを開発すること。
  • 3次元ゲート付き畳み込みと時間的PatchGANが動画品質および時間的整合性を顕著に向上させることを実証すること。

提案手法

  • 自由形式マスクの不確実性に対応できるように、マスク領域、未マスク領域、補間領域を区別する3次元ゲート付き畳み込み層を提案。これにより、特徴の注目が向上する。
  • 時間的整合性を向上させるために、高周波数の空間的・時間的特徴をペナルティ化する時間的PatchGAN判別器を導入。
  • データ拡張のため、さまざまなマスク対フレーム比を持つ多様で現実的なマスクを生成する自由形式マスク生成アルゴリズムを設計。
  • YouTube-VOSから1940本、YouTube-BoundingBoxesから12,600本の動画を収集し、FVIデータセットを構築。学習と評価に使用。
  • 生成器の最適化のために、 adversarial loss、perceptual loss、L1 loss の組み合わせを採用。これにより、現実的で一貫性のある動画補間が実現。
  • 光流を必要とせず、1段階で前向きに処理するアーキテクチャを採用。これにより、高速な推論とエンド・トゥ・エンドの学習が可能。

実験結果

リサーチクエスチョン

  • RQ13次元ゲート付き畳み込みは、任意形状のマスクが引き起こす不確実性を効果的に処理できるか?
  • RQ2標準的なGANと比較して、時間的PatchGAN判別器は時間的整合性を顕著に向上させるか?
  • RQ3本手法は、顔のような複雑で繰り返しのない構造を扱う際、パッチベースおよび画像ベースの補間モデルと比較してどのように優れているか?
  • RQ4新規に導入されたFVIデータセットは、自由形式の動画補間モデルの学習と評価をどの程度向上させるか?
  • RQ5提案されたアーキテクチャは、超解像やオブジェクト除去などの他の動画生成タスクへも拡張可能か?

主な発見

  • FaceForensicsデータセットにおいて、本モデルは最先端の性能を達成し、Fréchet Video Distance (FVD) が1.034、FIDが1.096と、従来手法を上回った。
  • オブジェクトのようなマスクを含む新規に導入されたFVIデータセットにおいて、FVDは0.1209、FIDは1.034を達成。汎用性と品質の高さが裏付けられた。
  • アブレーションスタディの結果、3次元ゲート付き畳み込みと時間的PatchGAN損失の両方が不可欠であることが確認され、いずれかを削除すると性能が著しく低下した。
  • 本モデルは動画超解像にも適応可能であり、4倍のアップサンプリングにおいて、perceptual distance (LPIPS) が0.1631、FIDが1.096を達成。SRResNetとSRGANを上回った。
  • 本モデルは動画オブジェクト除去や補間にも応用可能であり、複数の動画生成タスクにわたり、強固で多様な応用性を示した。
  • 非常に異なるテストデータや極めて厚いマスクを扱う際の限界は存在するが、ベースラインと比較して優れた性能を維持しており、特に視覚的整合性と時間的安定性において顕著な優位性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。