[論文レビュー] Locate then Segment: A Strong Pipeline for Referring Image Segmentation
本論文は、参照画像セグメンテーションのための単純だが効果的な「Locate then Segment」(LTS)パイプラインを提案する。この手法は、タスクを明示的なオブジェクト局在化と高精度なセグメンテーションに分離することで、視覚的および言語的特徴を統合し、局在化モジュールを用いて事前にオブジェクトの位置を予測し、軽量なセグメンテーションヘッドを適用することで、最先端の性能を達成した。RefCOCO+では+3.2%、RefCOCOgでは+3.4%の向上を達成し、先行研究を上回った。
Referring image segmentation aims to segment the objects referred by a natural language expression. Previous methods usually focus on designing an implicit and recurrent feature interaction mechanism to fuse the visual-linguistic features to directly generate the final segmentation mask without explicitly modeling the localization information of the referent instances. To tackle these problems, we view this task from another perspective by decoupling it into a "Locate-Then-Segment" (LTS) scheme. Given a language expression, people generally first perform attention to the corresponding target image regions, then generate a fine segmentation mask about the object based on its context. The LTS first extracts and fuses both visual and textual features to get a cross-modal representation, then applies a cross-model interaction on the visual-textual features to locate the referred object with position prior, and finally generates the segmentation result with a light-weight segmentation network. Our LTS is simple but surprisingly effective. On three popular benchmark datasets, the LTS outperforms all the previous state-of-the-art methods by a large margin (e.g., +3.2% on RefCOCO+ and +3.4% on RefCOCOg). In addition, our model is more interpretable with explicitly locating the object, which is also proved by visualization experiments. We believe this framework is promising to serve as a strong baseline for referring image segmentation.
研究の動機と目的
- 参照画像セグメンテーションにおける暗黙的で再帰的な特徴統合の限界を解消すること。これは、しばしばオブジェクト局在化を明示的にモデル化できない。
- 言語と視覚の相互作用を用いて、参照オブジェクトの空間的位置を明示的に予測することで、セグメンテーションの精度を向上させること。
- 複雑な最先端モデルを凌駕する、単純で解釈可能かつ効果的なパイプラインを開発すること。
- DCRFなどの後処理技術に依存を減らすために、ネットワーク内に直接リファインメントを統合すること。
提案手法
- まず、早期統合を用いて視覚的および言語的特徴をクロスモodal表現に統合する。
- 局在化モジュールが関連性フィルタリングを適用し、言語表現に基づいて最も関連性の高い画像領域を特定し、位置事前分布を生成する。
- 位置事前分布をクロスモダリティ特徴に連結して、セグメンテーションネットワークをガイドする。
- 最終的な高解像度セグメンテーションマスクを生成するために、軽量な完全畳み込みネットワーク(FCN)を用いる。
- 特徴の整合性を向上させるために、セグメンテーションと局在化の両方の監視を組み合わせたマルチタスク損失でモデルを訓練する。
- シンプルなバックボーン(例:ResNet)を用い、主ストリームで複雑な再帰的またはアテンション機構を避ける。

実験結果
リサーチクエスチョン
- RQ1明示的なオブジェクト局在化は、参照画像セグメンテーションにおけるセグメンテーション精度を向上させるか?
- RQ2局在化とセグメンテーションを分離することで、エンドツーエンド統合手法と比較して、より良いパフォーマンスと解釈可能性が得られるか?
- RQ3言語誘導特徴フィルタリングから得られる位置事前分布は、マスク品質にどのように影響するか?
- RQ4再帰的でない軽量なアーキテクチャは、このタスクにおいて、複雑な再帰的モデルを上回ることができるか?
主な発見
- LTSは、RefCOCOで66.75%のIoU、RefCOCO+で54.94%、RefCOCOgで54.51%を達成し、新たな最先端性能を記録した。
- 前回の最先端手法と比較して、RefCOCO+で+3.2%、RefCOCOgで+3.4%の向上を達成した。
- アブレーションスタディにより、局在化モジュールとセグメンテーションヘッドの両方が性能向上に顕著な寄与をしていることが確認された。
- より大きな入力解像度(480×480)を用いることで性能が向上し、RefCOCOバリデーションセットで65.90%のIoUを達成した。
- フィルタリングをトランスフォーマーに基づく局在化モジュールに置き換えることで、さらに性能が向上し、強力なアテンション機構の利点が示された。
- 可視化により、モデルがセグメンテーションの前に正しいオブジェクト領域に明示的に注目していることが確認され、解釈性が向上した。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。