Skip to main content
QUICK REVIEW

[論文レビュー] Language as Queries for Referring Video Object Segmentation

Jiannan Wu, Yi Jiang|arXiv (Cornell University)|Jan 3, 2022
Advanced Image and Video Retrieval Techniques被引用数 5
ひとこと要約

本論文は、言語記述を動的クエリとして扱い、動画フレーム内の参照オブジェクトに直接注目し、セグメンテーションを行う統合的Transformerベースのフレームワーク、ReferFormerを提案する。言語入力を条件としてオブジェクトクエリを設定することで、エンドツーエンドのセグメンテーションとトラッキングを可能にし、SOTAの性能を達成した。Swin-Largeバックボーンを用いることで、Ref-Youtube-VOSで64.2 J&Fを達成した。

ABSTRACT

Referring video object segmentation (R-VOS) is an emerging cross-modal task that aims to segment the target object referred by a language expression in all video frames. In this work, we propose a simple and unified framework built upon Transformer, termed ReferFormer. It views the language as queries and directly attends to the most relevant regions in the video frames. Concretely, we introduce a small set of object queries conditioned on the language as the input to the Transformer. In this manner, all the queries are obligated to find the referred objects only. They are eventually transformed into dynamic kernels which capture the crucial object-level information, and play the role of convolution filters to generate the segmentation masks from feature maps. The object tracking is achieved naturally by linking the corresponding queries across frames. This mechanism greatly simplifies the pipeline and the end-to-end framework is significantly different from the previous methods. Extensive experiments on Ref-Youtube-VOS, Ref-DAVIS17, A2D-Sentences and JHMDB-Sentences show the effectiveness of ReferFormer. On Ref-Youtube-VOS, Refer-Former achieves 55.6J&F with a ResNet-50 backbone without bells and whistles, which exceeds the previous state-of-the-art performance by 8.4 points. In addition, with the strong Swin-Large backbone, ReferFormer achieves the best J&F of 64.2 among all existing methods. Moreover, we show the impressive results of 55.0 mAP and 43.7 mAP on A2D-Sentences andJHMDB-Sentences respectively, which significantly outperforms the previous methods by a large margin. Code is publicly available at https://github.com/wjn922/ReferFormer.

研究の動機と目的

  • 参照動画オブジェクトセグメンテーション(R-VOS)における従来の二重ストリームパイプラインの限界を解決する。具体的には、複雑なマルチステージ設計と最適でないクロスマodal推論の問題を改善する。
  • ボトムアップ手法における明示的なインスタンスレベルの監視の欠如と、シーンの変化に対する一般化性能の低さを克服する。
  • 後処理によるトラッキングの必要性を排除し、条件付きアテンションによってフレーム間でクエリを自然に連結することで、エンドツーエンドの動画オブジェクトトラッキングを実現する。
  • 動画と言語入力のみを用いて、同時に検出・セグメンテーション・トラッキングを実行する統合的でエンドツーエンドのフレームワークを開発する。

提案手法

  • 入力された言語表現に条件づけられた、学習可能なオブジェクトクエリの少数を導入し、それらが参照オブジェクトにのみ注目できるように制限する。
  • これらの条件付きクエリを動的カーネルとして用い、新規の動的カーネルメカニズムにより特徴マップをフィルタリングし、セグメンテーションマスクを生成する。
  • 複数スケールで微細な視覚的・言語的特徴の相互作用を可能にする、クロスマodal特徴ピラミッドネットワーク(CM-FPN)を設計する。
  • 分類、バウンディングボックス、マスクマッチングコストを用いたクエリベースのラベル割り当て戦略を採用し、オブジェクトグラウディングを最適化する。
  • インスタンスマッチングを用いてフレーム間で対応するクエリをリンクさせ、後処理を必要としないエンドツーエンドの動画オブジェクトトラッキングを実現する。
  • 1回の順伝播でセグメンテーションマスク、検出ボックス、分類スコアを生成するTransformerベースのデコーダーを活用する。

実験結果

リサーチクエスチョン

  • RQ1言語を直接動画フレーム内の参照オブジェクトに注目させるクエリとして使用することで、R-VOSパイプラインを簡素化できるか?
  • RQ2条件付きクエリに基づく統合的でエンドツーエンドのフレームワークは、従来の二段階型またはボトムアップ型アプローチに比べ、精度と効率で優れているか?
  • RQ3類似したオブジェクトが多数存在する複雑なシーンにおいて、条件付きクエリの数が性能と頑健性に与える影響は何か?
  • RQ4クロスマodal特徴統合は、遮蔽や照明変化といった困難な視覚的条件下でのセグメンテーションをどの程度向上させるか?
  • RQ5追加の後処理を必要とせず、フレーム間でのクエリリンクによって自然にオブジェクトトラッキングが達成できるか?

主な発見

  • ResNet-50バックボーンを用いることで、ReferFormerはRef-Youtube-VOSで55.6 J&Fを達成し、前回のSOTAを8.4ポイント上回った。
  • Swin-Largeバックボーンを用いることで、ReferFormerはRef-Youtube-VOSで64.2 J&Fを達成し、新たなSOTA性能を樹立した。
  • A2D-Sentencesでは55.0 mAPを達成し、従来手法を顕著に上回った。
  • JHMDB-Sentencesでは43.7 mAPを達成し、アクション中心の参照表現への強力な一般化性能を示した。
  • アブレーションスタディの結果、5つの条件付きクエリを使用すると最適な性能が得られ、それ以上に増やすとラベル割り当ての不均衡により性能が低下した。
  • トレーニング用クリップフレーム数を1から5に増やすことで、J&Fが5.0ポイント向上し、時間的モデリングの重要性が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。