Skip to main content
QUICK REVIEW

[論文レビュー] VMFormer: End-to-End Video Matting with Transformer

Jiachen Li, Vidit Goel|arXiv (Cornell University)|Aug 26, 2022
Image Enhancement Techniques被引用数 8
ひとこと要約

VMFormerは、ビジョントランスフォーマーに基づき、学習可能なクエリとクロスアテンションを用いて、グローバルな画像および長距離時系列依存関係をモデル化する、エンドツーエンドでトリマップフリーな動画マットイング手法を提案する。実時間推論速度を達成しながら、コンポジットベンチマークで最先端の性能を発揮し、従来のCNNベースの手法を上回る。

ABSTRACT

Video matting aims to predict the alpha mattes for each frame from a given input video sequence. Recent solutions to video matting have been dominated by deep convolutional neural networks (CNN) for the past few years, which have become the de-facto standard for both academia and industry. However, they have inbuilt inductive bias of locality and do not capture global characteristics of an image due to the CNN-based architectures. They also lack long-range temporal modeling considering computational costs when dealing with feature maps of multiple frames. In this paper, we propose VMFormer: a transformer-based end-to-end method for video matting. It makes predictions on alpha mattes of each frame from learnable queries given a video input sequence. Specifically, it leverages self-attention layers to build global integration of feature sequences with short-range temporal modeling on successive frames. We further apply queries to learn global representations through cross-attention in the transformer decoder with long-range temporal modeling upon all queries. In the prediction stage, both queries and corresponding feature maps are used to make the final prediction of alpha matte. Experiments show that VMFormer outperforms previous CNN-based video matting methods on the composited benchmarks. To our best knowledge, it is the first end-to-end video matting solution built upon a full vision transformer with predictions on the learnable queries. The project is open-sourced at https://chrisjuniorli.github.io/project/VMFormer/

研究の動機と目的

  • CNNベースの動画マットイングモデルの限界、すなわち局所的なインダクティブバイアスと長距離モデリングの不足を是正すること。
  • 自己注意およびクロスアテンションメカニズムを活用してグローバルな特徴統合を実現するエンドツーエンドの動画マットイングフレームワークの開発。
  • クエリベースの時系列モデリングにより、過度な計算コストを伴わずに、ロバストな長距離時系列モデリングを実現すること。
  • 高い精度を維持しながら、実時間推論を達成すること。
  • トリマップの高価なアノテーションを不要にするために、トリマップフリーでエンドツーエンドのソリューションを設計すること。

提案手法

  • VMFormerは二重ブランチアーキテクチャを採用する:特徴モデリングブランチはCNNバックボーンとトランスフォーマーインコーダーで構成され、グローバル特徴抽出を実行する。クエリモデリングブランチはトランスフォーマー・デコーダーで構成され、アルファマット予測を実行する。
  • インコーダーにおける自己アテンションにより、各フレームの空間次元にわたるグローバルな特徴統合が可能になる。
  • デコーダーにおけるクロスアテンションにより、学習可能なクエリとグローバル特徴シーケンスを接続し、フレーム固有の予測を生成する。
  • 短距離特徴ベースの時系列モデリング(SFTM)は、連続する特徴マップの再帰的集約を用いて、局所的な時系列一貫性を向上させる。
  • 長距離クエリベースの時系列モデリング(LQTM)は、クエリ間の注意重みを学習することで、効率的な長距離時系列依存関係のモデリングを実現する。
  • 最終的なアルファマット予測は、各フレームのクエリと対応する特徴マップの行列積により生成される。

実験結果

リサーチクエスチョン

  • RQ1ビジョントランスフォーマー基盤のアーキテクチャは、グローバルな空間的依存関係および長距離時系列依存関係を捉えることで、CNNベースのモデルを上回る性能を発揮できるか?
  • RQ2学習可能なクエリとクロスアテンションを効果的に活用することで、トリマップの監視なしに正確なアルファマットを生成できるか?
  • RQ3計算コストを削減するために、フル特徴マップではなくクエリレベルでの時系列モデリングを効率的に実装できるか?
  • RQ4提案されたLQTMモジュールは、特徴ベースまたはポストプロセッシングの時系列手法と比較して、より優れた長距離時系列一貫性を実現できるか?
  • RQ5完全にトランスフォーマー基盤の動画マットイングモデルは、実時間推論を達成しながらも、最先端の精度を維持できるか?

主な発見

  • VMFormerは、VideoMatte240K、BG20K、DVMのコンポジットテストセットにおいて、512×288解像度で4.91 MAD、0.55 MSE、0.40 Grad、0.25 Connの最高性能を達成した。
  • 高解像度入力(1920×1080)では、4.81 MAD、0.78 MSE、4.90 Grad、3.34 Connを達成し、すべてのCNNベースのベースラインを上回った。
  • RVMテストセットでは、セグメンテーションデータを共同で学習したモデルを含む、比較対象のすべてのモデルを上回ったが、追加の事前学習は行わなかった。
  • モデルは実時間推論速度を維持しており、1枚のA6000 GPUで512×288解像度で、CNNベースのモデルと同等のFPSを達成した。
  • 可視化結果から、VMFormerは特に曖昧な領域や色がぼやけた領域において、より高品質な特徴マップを生成し、前景と背景の区別が明確であることが示された。
  • アブレーションスタディにより、SFTMにおける再帰的集約とLQTMにおける加法的アテンションが、低い計算コストで最良の性能を達成することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。