Skip to main content
QUICK REVIEW

[論文レビュー] Learning Joint Spatial-Temporal Transformations for Video Inpainting

Yanhong Zeng, Jianlong Fu|arXiv (Cornell University)|Jul 20, 2020
Generative Adversarial Networks and Image Synthesis参考文献 23被引用数 18
ひとこと要約

本稿では、複数スケールのパッチベース自己注意機構を用いて、すべての入力フレームにわたる欠損領域を同時に補完する、共同空間時系列変換器ネットワークであるSTTNを提案する。空間時系列対抗損失を最適化することで、STTNは最先端の性能を達成し、困難なマスク条件下で、従来手法比でPSNRを2.4%向上、VFIDを19.7%向上した。

ABSTRACT

High-quality video inpainting that completes missing regions in video frames is a promising yet challenging task. State-of-the-art approaches adopt attention models to complete a frame by searching missing contents from reference frames, and further complete whole videos frame by frame. However, these approaches can suffer from inconsistent attention results along spatial and temporal dimensions, which often leads to blurriness and temporal artifacts in videos. In this paper, we propose to learn a joint Spatial-Temporal Transformer Network (STTN) for video inpainting. Specifically, we simultaneously fill missing regions in all input frames by self-attention, and propose to optimize STTN by a spatial-temporal adversarial loss. To show the superiority of the proposed model, we conduct both quantitative and qualitative evaluations by using standard stationary masks and more realistic moving object masks. Demo videos are available at https://github.com/researchmm/STTN.

研究の動機と目的

  • フレームごとの動画補完における時間的不一致とぼやけを解消するため、空間的および時間的依存関係を共同でモデル化すること。
  • 複雑な動きや外観変化に耐えられず失敗する、フレーム単位または段階的な注目メカニズムの限界を克服すること。
  • 統一された変換器アーキテクチャを用いて、すべての入力フレームを同時に補完することで、動画補完の品質を向上させること。
  • 空間時系列対抗損失を導入することで、知覚的品質と時間的一貫性を向上させること。
  • 変換器内での多スケールで重複のないパッチ表現を用いることで、高速な学習と推論を実現すること。

提案手法

  • さまざまなサイズの重複のないパッチをすべてのフレームから抽出することで、多様な動きパターンを捉える多スケールパッチベース注目モジュールを提案する。
  • 複数ヘッド変換器を用いて、異なるスケールの空間的パッチ間の類似度を計算し、注目結果を統合して一貫性のあるコンテンツ生成を実現する。
  • 更新されたコンテキストを用いて欠損領域特徴を段階的に精緻化するため、複数の空間時系列変換器層をスタックする。
  • 時間的一貫性と知覚的品質の両方をフレーム全体で同時に最適化する空間時系列対抗損失を導入する。
  • 動画補完を「多対多」のタスクとして扱い、入力フレームを逐次ではなく同時に処理する。
  • STTNアーキテクチャを備えたジェネレータネットワークを用いて完成したフレームを生成し、対抗損失とエンドツーエンドで学習する。

実験結果

リサーチクエスチョン

  • RQ1フレームごとの手法と比較して、共同空間時系列変換器アーキテクチャは、時間的一貫性を向上させ、ぼやけを低減できるか?
  • RQ2多スケールパッチベース注目は、フレーム間の複雑な動きや外観変化を効果的にモデル化できるか?
  • RQ3複数の変換器層をスタックすることで、動画補完において一貫した性能向上が得られるか?
  • RQ4空間時系列対抗損失は、生成動画の知覚的品質を向上させ、時間的アーチファクトを低減できるか?
  • RQ5本手法は、移動物体や大規模な遮蔽を含む現実的で自由形状のマスク条件下でも効果を発揮するか?

主な発見

  • DAVISおよびYouTube-VOSデータセットにおける自由形状マスク条件下で、最先端手法比でPSNRが2.4%相対的に向上し、VFIDが19.7%相対的に向上した。
  • アブレーションスタディにより、多スケールパッチ表現が性能向上に顕著に寄与することが確認され、特に108×60、36×20、18×10、9×5のパッチサイズを組み合わせた場合に最良の結果が得られた。
  • 8層の変換器層をスタックした場合が最良の性能を示し、深さが増すにつれて継続的な改善が見られたことから、反復的精緻化の恩恵があることが示された。
  • ユーザースタディでは、静止マスクおよび移動マスクの両方で80%の試行でSTTNが最良のパフォーマンスを示し、優れた知覚的品質を裏付けた。
  • 強力な結果を示したが、大規模なマスク下で急激で連続的な動き(例:ダンス)を捉えることができず、3D時間的モデリングが欠如しているためぼやけが生じた。
  • 非重複の多スケールパッチ表現のおかげで、効率的で高速な学習と推論が実現され、リアルタイム動画理解タスクに適していることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。