Skip to main content
QUICK REVIEW

[論文レビュー] FuseFormer: Fusing Fine-Grained Information in Transformers for Video Inpainting

Rui Liu, Hanming Deng|arXiv (Cornell University)|Sep 7, 2021
Generative Adversarial Networks and Image Synthesis参考文献 42被引用数 7
ひとこと要約

FuseFormerは、ソフトスプリットおよびソフトコンポジション操作を用いて細粒度特徴統合を向上させることで、動画補間のための新しいトランスフォーマー・アーキテクチャを提案する。これにより、サブパッチレベルの相互作用が可能になり、エッジの鋭さと時間的整合性が向上する。Fusion Feed-Forward Network (F3N) を用いてこれらの操作をフィードフォワード・ネットワークに統合することで、最小限の計算コストで最先端の性能を達成する。

ABSTRACT

Transformer, as a strong and flexible architecture for modelling long-range relations, has been widely explored in vision tasks. However, when used in video inpainting that requires fine-grained representation, existed method still suffers from yielding blurry edges in detail due to the hard patch splitting. Here we aim to tackle this problem by proposing FuseFormer, a Transformer model designed for video inpainting via fine-grained feature fusion based on novel Soft Split and Soft Composition operations. The soft split divides feature map into many patches with given overlapping interval. On the contrary, the soft composition operates by stitching different patches into a whole feature map where pixels in overlapping regions are summed up. These two modules are first used in tokenization before Transformer layers and de-tokenization after Transformer layers, for effective mapping between tokens and features. Therefore, sub-patch level information interaction is enabled for more effective feature propagation between neighboring patches, resulting in synthesizing vivid content for hole regions in videos. Moreover, in FuseFormer, we elaborately insert the soft composition and soft split into the feed-forward network, enabling the 1D linear layers to have the capability of modelling 2D structure. And, the sub-patch level feature fusion ability is further enhanced. In both quantitative and qualitative evaluations, our proposed FuseFormer surpasses state-of-the-art methods. We also conduct detailed analysis to examine its superiority.

研究の動機と目的

  • パッチベースのトランスフォーマーにおける制限を解決する。具体的には、ハードパッチスプリットによるぼやけたエッジと、サブパッチ間の特徴相互作用の不足。
  • 重複するソフト操作を導入することで、トークナイゼーションおよび再構成時に空間的詳細を保持するサブパッチレベルの特徴統合を可能にする。
  • モデルパラメータや推論コストを著しく増加させることなく、動画補間のためのトランスフォーマーにおける特徴表現を向上させる。
  • 隣接するパッチ間でのより豊かな特徴伝搬を可能にすることで、生成された動画フレームの空間的および時間的整合性を向上させる。
  • 既存手法を上回る性能を発揮するが、計算コストが低く、軽量なアーキテクチャを構築する。

提案手法

  • ソフトスプリット(SS)を導入。これは、カーネルサイズ > ストライドのunfold操作を用いて、特徴マップから重複する2次元パッチを生成することで、サブパッチレベルの表現を可能にする。
  • ソフトコンポジション(SC)を設計。これは、ソフトスプリットの逆操作として、トークンを再び2次元パッチに再形状し、隣接するパッチからの重複ピクセル特徴を合算することで、再構成を実現する。
  • SSおよびSCをトランスフォーマーのトークナイゼーションおよびデートークナイゼーション段階に統合し、トークンと細粒度特徴の間の効果的マッピングを可能にする。
  • Fusion Feed-Forward Network(F3N)を提案。これは、標準的な1次元MLPを再構造化することで、トークンを2次元に再形状し、ソフトコンポジションを適用した後、再エンコードすることで、2次元構造モデリングを強化する。
  • 訓練の安定化とさらなる性能向上を図るため、新しい正規化技術(式8)を適用する。
  • ヴァニラ・トランスフォーマーに多フレームパッチ埋め込みと軽量な畳み込みエンコーダ/デコーダを組み合わせた強力なベースライン、ViB-Tを構築。その後、ソフト操作を統合してViB-Sを構築し、最終的にFuseFormerを構築する。

実験結果

リサーチクエスチョン

  • RQ1重複するパッチ操作(ソフトスプリットおよびソフトコンポジション)は、動画補間用トランスフォーマーにおける細粒度特徴表現を向上させることができるか?
  • RQ2ソフト操作によるサブパッチレベルの特徴統合は、生成された動画フレームのエッジの鋭さと視覚的品質にどのように影響を与えるか?
  • RQ3F3Nモジュールは、モデルパラメータを増加させることなく、フィードフォワード・ネットワークにおける特徴学習をどの程度向上させることができるか?
  • RQ4ソフト操作をトランスフォーマー・アーキテクチャに統合することで、ハードパッチベース手法と比較して動画補間ベンチマークでより優れた性能を達成できるか?
  • RQ5提案手法は、計算コストと推論時間を低く保ちながら、最先端の結果を達成できるか?

主な発見

  • FuseFormerはYouTubeVOSで最先端の手法を上回り、最良のベースライン比でPSNRが3.3%向上、SSIMが0.7%向上した。
  • FuseFormerはVFIDとワープエラーをそれぞれ7.4%および7.8%低減し、生成動画のリアリズムと時間的整合性の優位性を示した。
  • ユーザー評価では、動画補完において68%、オブジェクト除去において71%の被験者がFuseFormerを第一位に選んだ。これは、その知覚的品質の優位性を裏付けている。
  • ソフト操作を組み込んだViB-Sモデルは、STTNをすでに上回っており、ソフト操作そのものが最小限の追加コストで顕著な性能向上をもたらすことを示している。
  • F3Nモジュールは、トランスフォーマーブロック内の標準MLPに置き換えることで性能を向上させ、サブパッチ特徴統合の効果を実証した。
  • 定性的な結果から、FuseFormerはより鋭いエッジと、フレーム間でより整合性の高いコンテンツを生成しており、深層部では粗い特徴から細かい特徴へと段階的に精錬されていることがわかる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。