Skip to main content
QUICK REVIEW

[論文レビュー] Deficiency-Aware Masked Transformer for Video Inpainting

Yongsheng Yu, Heng Fan|arXiv (Cornell University)|Jul 17, 2023
Generative Adversarial Networks and Image Synthesis被引用数 5
ひとこと要約

本稿では、欠損ケース(複数フレームにわたってマスクされたコンテンツが存在しない状況)における幻覚を向上させるために事前学習済み画像補完モデル(DMT$_{\text{img}}$)を事前知識として活用する、二モダリティ対応の動画補完フレームワーク「欠損感知型マスク付きTransformer(DMT)」を提案する。トークン選択、マスク活性化、および受容 field コンテキストライザーを統合することで、計算コストを低減し、特徴表現学習を向上させ、DAVISでは0.81 dB、YouTube-VOSでは0.56 dBのPSNR向上を達成し、最先端性能を実現した。

ABSTRACT

Recent video inpainting methods have made remarkable progress by utilizing explicit guidance, such as optical flow, to propagate cross-frame pixels. However, there are cases where cross-frame recurrence of the masked video is not available, resulting in a deficiency. In such situation, instead of borrowing pixels from other frames, the focus of the model shifts towards addressing the inverse problem. In this paper, we introduce a dual-modality-compatible inpainting framework called Deficiency-aware Masked Transformer (DMT), which offers three key advantages. Firstly, we pretrain a image inpainting model DMT_img serve as a prior for distilling the video model DMT_vid, thereby benefiting the hallucination of deficiency cases. Secondly, the self-attention module selectively incorporates spatiotemporal tokens to accelerate inference and remove noise signals. Thirdly, a simple yet effective Receptive Field Contextualizer is integrated into DMT, further improving performance. Extensive experiments conducted on YouTube-VOS and DAVIS datasets demonstrate that DMT_vid significantly outperforms previous solutions. The code and video demonstrations can be found at github.com/yeates/DMT.

研究の動機と目的

  • マスクされたコンテンツがすべてのフレームに存在しない欠損ケースにおける動画補完の課題に対処すること。
  • 画像補完と動画補完の間のドメインギャップを埋め、事前学習済み画像補完モデルから知識を動画生成に転送すること。
  • 有効な時空間的トークンを効率的に処理し、無効なトークンをヒューリスティックなメカニズムで活性化することで、推論の効率性と頑健性を向上させること。
  • 高周波数信号を捉える新しい受容 field コンテキストライザー(RFC)を用いて受容 field を拡張し、特徴表現を強化すること。
  • フレーム単位のマスクを必要とせず、テキストまたはストローク入力に適応することでワンショットオブジェクト除去を可能にし、実世界への適用性を高めること。

提案手法

  • 欠損ケースにおける補完のための事前知識として機能するスタンドアロンの画像補完モデル(DMT$_{\text{img}}$)を事前学習し、幻覚性能を向上させる。
  • 連続的学習損失を用いて、DMT$_{\text{img}}$ からの知識を転送しながら、プラスティシティとステービリティのバランスを保ちつつ、DMT$_{\text{vid}}$ をスクラッチから訓練する。
  • 内部ピクセルがすべてマスクされている時空間的トークンを破棄する「トークン選択」機構を導入し、ノイズと計算コストを低減する。
  • 自己注意および畳み込み演算中に反復的に無効なトークンを活性化することで、特徴表現学習を向上させる「マスク活性化」アルゴリズムを提案する。
  • 大きなカーネルサイズ(K=13)を有する受容 field コンテキストライザー(RFC)を統合し、受容 field を拡大して高周波数ディテールを捉える。
  • 移行正則化(式5)を適用することで、画像データセットへのアクセスを必要とせず、画像モデルから動画モデルへの生成的事前知識を転送する。

実験結果

リサーチクエスチョン

  • RQ1事前学習済み画像補完モデルが、欠損ケースにおける動画補完のための効果的かつ有用な事前知識として機能できるか?
  • RQ2画像補完と動画補完の間のドメインギャップをどのように埋め、知識を効果的に転送できるか?
  • RQ3計算複雑性とノイズを低減しつつ、性能を維持するためのメカニズムは何か?
  • RQ4受容 field を拡大することで、特徴表現および補完品質にどの程度の向上が得られるか?
  • RQ5提案されたフレームワークは、フレーム単位のマスク監視が不要なワンショットオブジェクト除去タスクにも一般化可能か?

主な発見

  • DMT$_{\text{vid}}$ は、DAVISデータセットで前回の最先端手法比0.81 dB、YouTube-VOSで0.56 dBのPSNR向上を達成し、最先端の性能を示した。
  • K=13の受容 field コンテキストライザー(RFC)が最良の性能を発揮し、RFCなしのベースライン比0.48 dB、FFCベースの代替手法比0.14 dBのPSNR向上を達成した。
  • マスク活性化機構を省略するとPSNRが1.84 dB低下し、無効なトークンの再構築においてその重要性が明確になった。
  • トークン選択により、完全にマスクされたトークンをフィルタリングすることで計算コストを低減し、推論効率を向上させた。この機構を省略するとPSNRが0.08 dB低下した。
  • 移行正則化により、画像モデルから動画モデルへの知識転送が可能となり、これを除外するとPSNRが0.31 dB低下した。
  • モデルは、学習分布外のアニメーション動画を含む実世界のシナリオにも良好に一般化でき、テキストまたはストローク入力によるワンショットオブジェクト除去をサポートした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。