[論文レビュー] RefSAM: Efficiently Adapting Segmenting Anything Model for Referring Video Object Segmentation
本稿では、最初のフレームに真のマスクが存在しない状況下で、言語と視覚モodalの間のゼロショット、エンドツーエンドの整合性を必要とする参照動画オブジェクトセグメンテーション(RVOS)のための、最初のエンドツーエンド、SAMベースのフレームワークであるRefSAMを提案する。この手法は、軽量なクロスモーダルMLP、階層的で密集したアテンション、および暗黙的なトラッキングモジュールを通じて、マルチモーダル(視覚・言語)および時間的(フレーム単位)情報を統合することで、Segment Anything Model(SAM)を効率的に適応させる。RefSAMは、Ref-Youtube-VOSおよびRef-DAVIS17でそれぞれ74.1%のmIoUと72.8%のoIoUを達成し、最先端の性能を発揮するとともに、高い推論速度(ViT-Bを用いた9.5 FPS)を維持している。
The Segment Anything Model (SAM) has gained significant attention for its impressive performance in image segmentation. However, it lacks proficiency in referring video object segmentation (RVOS) due to the need for precise user-interactive prompts and a limited understanding of different modalities, such as language and vision. This paper presents the RefSAM model, which explores the potential of SAM for RVOS by incorporating multi-view information from diverse modalities and successive frames at different timestamps in an online manner. Our proposed approach adapts the original SAM model to enhance cross-modality learning by employing a lightweight Cross-Modal MLP that projects the text embedding of the referring expression into sparse and dense embeddings, serving as user-interactive prompts. Additionally, we have introduced the hierarchical dense attention module to fuse hierarchical visual semantic information with sparse embeddings to obtain fine-grained dense embeddings, and an implicit tracking module to generate a tracking token and provide historical information for the mask decoder. Furthermore, we employ a parameter-efficient tuning strategy to align and fuse the language and vision features effectively. Through comprehensive ablation studies, we demonstrate our model's practical and effective design choices. Extensive experiments conducted on Refer-Youtube-VOS, Ref-DAVIS17, and three referring image segmentation datasets validate the superiority and effectiveness of our RefSAM model over existing methods.
研究の動機と目的
- 最初のフレームに真のマスクが存在しない状況下で、言語と視覚モダリティの間のゼロショット、エンドツーエンドの整合性を必要とする参照動画オブジェクトセグメンテーション(RVOS)に、Segment Anything Model(SAM)を適応させる課題に対処すること。
- 外部オブジェクト検出器(例:Grounding DINO)に依存する既存のSAMベースの手法が、最初のフレームのバウンディングボックスを必要とすることによるパイプラインエラーとエンドツーエンドの能力の低下を克服すること。
- パラメータ効率の良い方法で、階層的な視覚特徴とスパースなテキスト誘導プロンプトを統合することで、動画における言語と視覚の間の効果的なクロスモーダル理解を実現すること。
- 最先端の性能を達成しながらも、高い推論速度を維持する軽量で効率的なアーキテクチャを設計すること。
提案手法
- テキスト埋め込みをT5-3bエンコーダーから取得し、スパースおよび密集したプロンプトに変換する軽量なクロスモーダルMLPを導入し、言語誘導セグメンテーションのための従来のポイント/バウンディングボックスプロンプトに代わる。
- マルチスケールの視覚特徴とスパースなテキスト誘導埋め込みを統合する階層的で密集したアテンションモジュールを提案し、正確なマスク予測のための細粒度の密集した埋め込みを生成する。
- 直前のフレームのマスク予測からトラックトークンを生成することで、マスクデコーダーに歴史的文脈を提供する暗黙的トラッキングモジュールを設計し、時間的整合性を実現する。
- パラメータ効率の良いチューニング戦略(例:LoRAスタイルの適応)を採用し、少数のパラメータのみを微調整することで、SAMの一般化能力を保持しつつ、クロスモーダル整合性を実現する。
- プロンプトエンコーダーとマスクデコーダーを変更することで、オリジナルのSAMアーキテクチャをオンラインでフレーム単位の推論設定において、視覚的および言語的埋め込みを両方受け入れるように適応する。
- ViTベースの視覚エンコーダー(ViT-B/L/H)とT5-3bテキストエンコーダーを用い、動画および参照画像セグメンテーションデータセットで共同学習することで、ゼロショット一般化能力を向上させる。
実験結果
リサーチクエスチョン
- RQ1外部オブジェクト検出器に依存せず、最初のフレームに真のマスクが存在しない状況下で、Segment Anything Model(SAM)をエンドツーエンド、ゼロショットで参照動画オブジェクトセグメンテーション(RVOS)に効果的に適応させることは可能か?
- RQ2最初のフレームに真のマスクが存在しない状況下で、言語と視覚特徴の間のクロスモーダル整合性を、動画セグメンテーションにおいてどのように向上させられるか?
- RQ3マルチスケールの視覚特徴と言語誘導スパースプロンプトを統合する際に、最も効果的なアーキテクチャ的要素は何か? これはマスクの正確性を向上させる。
- RQ4暗黙的トラッキング機構は、オンラインセグメンテーション設定において、時間的整合性を向上させ、フレーム間での誤差蓄積を低減するのに有効か?
- RQ5パラメータ効率の良い微調整は、SAMの一般化能力をどの程度保持しつつ、RVOSへの効果的な適応を可能にするか?
主な発見
- RefSAMはRef-Youtube-VOSで74.1%のmIoU、Ref-DAVIS17で72.8%のoIoUを達成し、両ベンチマークで新たな最先端の結果を樹立した。
- 参照画像セグメンテーションデータセット(RefCOCO, RefCOCO+, G-Ref)において、RefSAMはRefCOCOで76.77%のmIoU、G-Refで70.14%を達成し、LAVT や RefTR といった先行手法を上回った。
- ViT-Bバックボーンを用いた場合、RefSAMは9.5 FPSの推論速度を達成し、SAM-Track(1.5 FPS)やPerSAM(4.0 FPS)を上回り、強化された機能にもかかわらず高い効率性を示した。
- アブレーションスタディの結果、階層的で密集したアテンションモジュールと暗黙的トラッキングモジュールがそれぞれ顕著な性能向上に寄与しており、クロスモーダルMLPは効果的な言語プロンプト生成に不可欠であることが確認された。
- パラメータ効率の良いチューニングにより、RefSAMはViT-Hを用いてもたった6.7Mパラメータで実現可能であり、元のSAM(641.1M)のほんの一部にとどまる。これはその効率性とスケーラビリティを裏付ける。
- モデルは参照画像セグメンテーションタスクに対しても良好に一般化し、3つの標準データセットで最先端の結果を達成した。これは、動画を越えた応用における汎用性を示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。