Skip to main content
QUICK REVIEW

[論文レビュー] Vision-Language Transformer and Query Generation for Referring Segmentation

Henghui Ding, Chang Liu|arXiv (Cornell University)|Aug 12, 2021
Multimodal Machine Learning Applications参考文献 30被引用数 16
ひとこと要約

本稿では、参照セグメンテーションのためのクエリ生成およびバランスモジュールを備えたビジョン・ランゲージトランスフォーマー(VLT)を提案する。このタスクは、アテンションに基づく画像クエリ問題に再定式化される。視覚的特徴に従ってガイドされた複数の多様な言語クエリを生成し、それらの応答を適応的に統合することで、複雑なコンponentsを用いずにRefCOCO、RefCOCO+、G-Refデータセットで最先端の性能を達成する。

ABSTRACT

In this work, we address the challenging task of referring segmentation. The query expression in referring segmentation typically indicates the target object by describing its relationship with others. Therefore, to find the target one among all instances in the image, the model must have a holistic understanding of the whole image. To achieve this, we reformulate referring segmentation as a direct attention problem: finding the region in the image where the query language expression is most attended to. We introduce transformer and multi-head attention to build a network with an encoder-decoder attention mechanism architecture that "queries" the given image with the language expression. Furthermore, we propose a Query Generation Module, which produces multiple sets of queries with different attention weights that represent the diversified comprehensions of the language expression from different aspects. At the same time, to find the best way from these diversified comprehensions based on visual clues, we further propose a Query Balance Module to adaptively select the output features of these queries for a better mask generation. Without bells and whistles, our approach is light-weight and achieves new state-of-the-art performance consistently on three referring segmentation datasets, RefCOCO, RefCOCO+, and G-Ref. Our code is available at https://github.com/henghuiding/Vision-Language-Transformer.

研究の動機と目的

  • 関係的記述によって特定されるターゲットオブジェクトを識別するタスクにおいて、画像と言語の包括的理解を向上させること。
  • 畳み込みネットワークがビジョン・ランゲージタスクにおける長距離依存関係やグローバルな文脈をモデル化する点で抱える制限を克服すること。
  • クエリの多様な言語的解釈を生成することで、曖昧または複雑な参照表現に対する耐性を高めること。
  • 視覚的キューを用いて、最も関連性の高い解釈を強調するように、複数のクエリ応答を適応的に統合すること。

提案手法

  • 参照セグメンテーションを、言語表現が画像の関連領域に注目するためのクエリとして機能する直接的なアテンション問題に再定式化する。
  • ビジョンと言語の特徴間のグローバルな相互作用をモデル化するため、マルチヘッド自己注意およびクロス注意を備えたトランスフォーマー基盤のエンコーダ・デコーダアーキテクチャを採用する。
  • 言語特徴から視覚的ガイドに従ってN個のクエリベクトルを生成するクエリ生成モジュール(QGM)を導入する。各クエリベクトルは、参照表現の異なる理解を表す。
  • クエリの応答の関連性に基づき、複数のクエリからの特徴を適応的に重み付け・統合するクエリバランスモジュールを用いる。これにより応答品質が向上する。
  • 学習中に学習可能なクエリベクトルを用い、初期化は一様に設定し、ネットワークの他の部分と同時に最適化する。
  • 動的に生成されるクエリベクトルは、文脈に応じて言語表現の異なる側面を反映する視覚誘導アテンションを用いる。

実験結果

リサーチクエスチョン

  • RQ1参照セグメンテーションにおいて、ビジョン・ランゲージモデルはどのようにしてグローバルな文脈や長距離依存関係をよりよく捉えることができるか?
  • RQ2複数の多様な参照表現の解釈をどのように生成し、それを活用してセグメンテーション精度を向上させることができるか?
  • RQ3複数のクエリ応答の適応的統合は、単一クエリや固定クエリアプローチよりも優れたマスク予測を達成できるか?
  • RQ4複数の属性や関係を含む長大または複雑な参照表現に対して、モデルはどのように動作するか?

主な発見

  • 提案されたVLTモデルは、RefCOCO、RefCOCO+、G-Refデータセットで新たな最先端性能を達成し、RefCOCOでは1%のIoU向上、より困難なRefCOCO+ testBスプリットでは5%の向上を示した。
  • より長い表現を含むG-Refデータセットでは、先行手法よりも2%〜5%高いIoUを達成し、複雑かつ長大な記述に対する有効性を示した。
  • 16個のクエリベクトルを用いることで最良の性能が得られ、1から16のクエリにわたるIoUで5%の向上を示した。これは、複数の多様なクエリがモデリング能力を著しく向上させることを示している。
  • クエリバランスモジュールを削除すると約1%の性能低下が生じ、その有効性が確認された。
  • 可視化結果から、トランスフォーマーが単一レイヤー内で遠く離れた画像領域に注目していることが確認され、長距離依存関係をモデル化できる能力が裏付けられた。
  • クエリ生成モジュールは、特徴空間における明確に異なる注目パターンを示すことで、言語表現の異なる側面から理解を生成する多様なクエリベクトルを生成している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。