Skip to main content
QUICK REVIEW

[論文レビュー] SeqFormer: Sequential Transformer for Video Instance Segmentation

Junfeng Wu, Yi Jiang|arXiv (Cornell University)|Dec 15, 2021
Video Analysis and Summarization被引用数 6
ひとこと要約

SeqFormerは、動く対象を時間的に跨いで注目できるフレーム固有のインスタンスクエリを用いる、動画インスタンスセグメンテーション向けの逐次的Transformerアーキテクチャを提案する。これにより、トラッキングブランチや後処理を必要とせず、エンドツーエンドでマスクとボックス予測が可能となる。ResNet-101を用いたYouTube-VISでは49.0 APを達成し、SOTAを著しく上回る性能を示した。

ABSTRACT

In this work, we present SeqFormer for video instance segmentation. SeqFormer follows the principle of vision transformer that models instance relationships among video frames. Nevertheless, we observe that a stand-alone instance query suffices for capturing a time sequence of instances in a video, but attention mechanisms shall be done with each frame independently. To achieve this, SeqFormer locates an instance in each frame and aggregates temporal information to learn a powerful representation of a video-level instance, which is used to predict the mask sequences on each frame dynamically. Instance tracking is achieved naturally without tracking branches or post-processing. On YouTube-VIS, SeqFormer achieves 47.4 AP with a ResNet-50 backbone and 49.0 AP with a ResNet-101 backbone without bells and whistles. Such achievement significantly exceeds the previous state-of-the-art performance by 4.6 and 4.4, respectively. In addition, integrated with the recently-proposed Swin transformer, SeqFormer achieves a much higher AP of 59.3. We hope SeqFormer could be a strong baseline that fosters future research in video instance segmentation, and in the meantime, advances this field with a more robust, accurate, neat model. The code is available at https://github.com/wjf5203/SeqFormer.

研究の動機と目的

  • 分離されたトラッキングブランチや後処理を回避する、洗練されたエンドツーエンドのフレームワークを構築すること。
  • 共有インスタンスクエリをフレームレベルのクエリに分解することで、各フレームごとに独立したアテンションを可能にし、フレーム間の時間的関係をモデル化すること。
  • フレーム間の特徴を重み付き集約することで、強固で動画レベルのインスタンス表現を学習し、トラッキングおよびセグメンテーションの精度を向上させること。
  • 今後の動画インスタンスセグメンテーション分野における研究の強力で効率的かつ汎用性の高いベースラインを確立すること。

提案手法

  • 1つのインスタンスクエリをフレームレベルのボックスクエリに分解し、各フレームで独立したアテンション機構を可能にすることで、時間的に対象の動きに整合させる。
  • 粗くから細かくまで段階的に改善するアプローチに従い、Deformable DETRに類似したイテレーティブな精製手法を用いたデコーダーを採用して、ボックスシーケンスを予測・精製する。
  • ボックス埋め込みから得られる学習可能な重みを用いて、フレーム間で整合化されたインスタンス領域からの特徴を集約し、統一された動画レベルのインスタンス表現を形成する。
  • 精製されたインスタンス表現を用いて、マスクヘッドのための動的畳み込み重みを生成し、各フレームごとの正確なマスク予測を可能にする。
  • フラット化を避けて、完全な空間的・時間的特徴次元を保持する。これは性能に極めて重要であることが示されている。
  • 異なるフレームからの特徴を重み付き和で集約し、ボックス埋め込みからエンドツーエンドで学習されたアテンション重みを用いることで、情報の希釈を回避する。

実験結果

リサーチクエスチョン

  • RQ1各フレームで独立してアテンションを適用する際、1つの共有インスタンスクエリが長い動画シーケンスにおけるインスタンス関係を効果的にモデル化できるか?
  • RQ2フラット化またはマルチスケールアプローチと比較して、完全な空間的・時間的特徴次元を保持することの性能に与える影響は?
  • RQ3フレーム間のエンドツーエンドで学習されたアテンション重みは、単純な和または平均集約と比較して、インスタンス表現およびマスク予測を改善できるか?
  • RQ4限定的なフレーム数で学習したマスクヘッドが、動画内の未観測フレームにどれほど一般化できるか?
  • RQ5提案されたクエリ分解機構は、明示的なトラッキングブランチや後処理を必要とせず、自然にインスタンストラッキングを可能にするか?

主な発見

  • ResNet-50バックボーンを用いたYouTube-VISでは47.4 APを達成し、ResNet-101では49.0 APを記録。前者は前人最高を4.6 AP上回り、後者は4.4 AP上回った。
  • ResNeXt-101バックボーンを用いることで51.2 APを達成し、YouTube-VISで50 APを超える初のアルゴリズムとなった。
  • Swin Transformerと統合した場合、59.3 APを達成し、高度なバックボーンからのスケーラビリティと性能向上の可能性を示した。
  • 1つのフレームからのみインスタンス表現を生成すると38.1 AP、5つのフレームで44.6 APを達成し、未観測フレームへの強い一般化能力を示した。
  • 完全な空間的・時間的特徴次元を保持することで、フラット化と比較して7.4 APの向上が得られ、マルチスケール特徴はさらに2.6 APの向上をもたらした。これは時間的モデリングの重要性を裏付けた。
  • フレーム間の重み付き和集約では45.1 APを達成し、和(30.6 AP)や平均(43.2 AP)を上回り、キーポイントとなるインスタンスの手がかりを効果的に保持していることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。