[論文レビュー] One Token to Seg Them All: Language Instructed Reasoning Segmentation in Videos
VideoLISA は、大規模言語モデルの推論と Segment Anything Model (SAM) を組み合わせることで、動画における言語指令付き推論セグメンテーションを可能にする動画ベースのマルチモーダル大規模言語モデルです。空間的・時間的特徴を効率的に符号化するためのスパース・ディンス・サムプリング戦略と、<TRK> トークンを用いたワン・トークン・セグ・オール手法を導入し、時間的に一貫性のあるセグメンテーションマスクを生成します。これにより、動画および画像セグメンテーションベンチマーク(新規の ReasonVOS ベンチマークを含む)で最先端の性能を達成しました。
We introduce VideoLISA, a video-based multimodal large language model designed to tackle the problem of language-instructed reasoning segmentation in videos. Leveraging the reasoning capabilities and world knowledge of large language models, and augmented by the Segment Anything Model, VideoLISA generates temporally consistent segmentation masks in videos based on language instructions. Existing image-based methods, such as LISA, struggle with video tasks due to the additional temporal dimension, which requires temporal dynamic understanding and consistent segmentation across frames. VideoLISA addresses these challenges by integrating a Sparse Dense Sampling strategy into the video-LLM, which balances temporal context and spatial detail within computational constraints. Additionally, we propose a One-Token-Seg-All approach using a specially designed token, enabling the model to segment and track objects across multiple frames. Extensive evaluations on diverse benchmarks, including our newly introduced ReasonVOS benchmark, demonstrate VideoLISA's superior performance in video object segmentation tasks involving complex reasoning, temporal understanding, and object tracking. While optimized for videos, VideoLISA also shows promising generalization to image segmentation, revealing its potential as a unified foundation model for language-instructed object segmentation. Code and model will be available at: https://github.com/showlab/VideoLISA.
研究の動機と目的
- 動画における言語指令付き推論セグメンテーションの課題に取り組むこと。これは、時間的理解とフレーム間の一貫性のあるセグメンテーションを要請する。
- 画像ベースのモデル(例:LISA)が動画タスクに適用される際、追加の時間次元によって生じる制限を克服すること。
- 自然言語指示に基づき、動画および画像セグメンテーションの両方を統合的に処理できる基盤モデルを実現すること。
- 計算効率と高精度な空間的・時間的表現の両立を図る、密度予測タスクに適した手法を設計すること。
- 新規ベンチマークである ReasonVOS を用いて、モデルの推論能力、トラッキング能力、一般化能力を評価すること。
提案手法
- 空間的解像度を保ったまま均一にフレームをサンプリングし、交互に間引きされたフレームをダウンサンプリングすることで、計算負荷を軽減しながらも時間的ダイナミクスを保持するスパース・ディンス・サムプリング戦略を導入する。
- 動画に内在する時間的再帰性を活用し、入力表現における空間的詳細と時間的文脈のバランスを図る。
- 複数フレームにわたる統一された空間的・時間的オブジェクト表現を符号化するための専用 <TRK> トークンを用いたワン・トークン・セグ・オール手法を提案する。
- <TRK> トークンを複数フレームのセグメンテーションマスクを同時に予測するように訓練することで、単一フレームの空間的ヒントに基づく短絡的学習を防ぐ。
- 大規模言語モデル(LLM)と Segment Anything Model (SAM) を統合し、自然言語指示から高品質なセグメンテーションマスクを生成する。
- サンプリングされたフレームからの視覚的特徴を処理する動画用 LLM アーキテクチャを採用し、LLM を用いて空間的および時間的コンテンツの両方を推論する。
実験結果
リサーチクエスチョン
- RQ1複雑な自然言語指示が与えられた場合、マルチモーダル LLM は推論ベースの動画オブジェクトセグメンテーションを効果的に実行できるか?
- RQ2単一のプロンプト・トークンを用いて、複数の動画フレーム間でセグメンテーションマスクの時間的整合性をどのように達成できるか?
- RQ3計算効率と空間的・時間的情報の保持の両立を最適化するための、動画-LLM アーキテクチャにおいて最適なサンプリング戦略は何か?
- RQ4動画-LLM は、強力な推論およびトラッキング能力を維持しつつ、画像セグメンテーションタスクにどの程度一般化できるか?
- RQ5ワン・トークン・セグ・オール手法は、フレーム単位処理やトラッキング拡張ベースのベースラインと比較して、精度および一貫性の面でどの程度優れているか?
主な発見
- VideoLISA は、動き誘導型および参照セグメンテーションタスクを含む、複数の動画オブジェクトセグメンテーションベンチマークで最先端の性能を達成した。
- スパース・ディンス・サムプリング戦略は、フレーム連結、STプーリング、スローファストサンプリングなどの代替手法を上回り、詳細と文脈の両立の有効性を示した。
- ワン・トークン・セグ・オール手法は時間的整合性を顕著に向上させ、単一 <SEG> トークンを用いたベースラインおよび外部トラッカーを統合した LISA ベースの手法を上回った。
- アブレーションスタディにより、<TRK> トークンが複数フレームにわたって同時に学習されていることが、短絡的学習の防止およびフレーム間オブジェクト関連付けの実現に不可欠であることが確認された。
- VideoLISA は画像セグメンテーションタスクにも良好に一般化し、画像推論および参照セグメンテーションベンチマークで強力な性能を示した。
- 新規に導入された ReasonVOS ベンチマークにおいて、複雑な複数フレーム推論タスクを評価する上で、優れた推論およびトラッキング能力を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。