[論文レビュー] Improving Visual Grounding with Visual-Linguistic Verification and Iterative Reasoning
本論文では、視覚的言語的検証と反復的クロスモーダル推論を用いて精度を向上させるトランスフォーマー基盤の視覚的グランドイングフレームワークを提案する。言語に関連する視覚的領域に焦点を当て、文脈特徴を統合することで、対象物体の特徴の明確化を図り、マルチステージデコーダーを用いて局所化を精緻化する。5つのベンチマークデータセットにおいて、最小限のパラメータ増加と計算コスト増加で最先端の性能を達成した。
Visual grounding is a task to locate the target indicated by a natural language expression. Existing methods extend the generic object detection framework to this problem. They base the visual grounding on the features from pre-generated proposals or anchors, and fuse these features with the text embeddings to locate the target mentioned by the text. However, modeling the visual features from these predefined locations may fail to fully exploit the visual context and attribute information in the text query, which limits their performance. In this paper, we propose a transformer-based framework for accurate visual grounding by establishing text-conditioned discriminative features and performing multi-stage cross-modal reasoning. Specifically, we develop a visual-linguistic verification module to focus the visual features on regions relevant to the textual descriptions while suppressing the unrelated areas. A language-guided feature encoder is also devised to aggregate the visual contexts of the target object to improve the object's distinctiveness. To retrieve the target from the encoded visual features, we further propose a multi-stage cross-modal decoder to iteratively speculate on the correlations between the image and text for accurate target localization. Extensive experiments on five widely used datasets validate the efficacy of our proposed components and demonstrate state-of-the-art performance. Our code is public at https://github.com/yangli18/VLTVG.
研究の動機と目的
- 一般的なオブジェクト検出器と固定されたプロポーザルに依存する既存の視覚的グランドイング手法の限界、すなわち特徴の柔軟性と文脈モデリングの制限を是正すること。
- 言語に従う注視と文脈の統合を用いて、より判別性の高い視覚的特徴を構築することで、視覚的グランドイングの精度を向上させること。
- 画像とテキスト間の相関を段階的に精緻化するマルチステージクロスモーダル推論により、正確な局所化を実現すること。
- 事前に生成されたプロポーザルに依存しないようにし、専用モジュールを介して直接的にターゲットオブジェクトの特徴を取得すること。
- モデルサイズと推論コストの増加を最小限に抑えつつ、最先端の性能を達成すること。
提案手法
- 視覚的特徴とテキスト埋め込みを比較することで、関係のない画像領域を抑制し、言語クエリと整合する領域を強調する視覚的言語的検証モジュールを導入する。
- ターゲットオブジェクトの周囲の空間的に隣接する視覚的特徴を、注視メカニズムを用いて統合することで、その特徴の明確化を図る言語に従う文脈エンコーダーを採用する。
- 段階的に画像と言語の特徴間の整合性を精緻化するマルチステージクロスモーダルデコーダーを設計し、段階的な推論により局所化精度を向上させる。
- 検証モジュールからのモodulated視覚的特徴をデコーダーの入力として使用することで、関連する画像領域に焦点を当てた推論を可能にする。
- 各ステージで動的に関連する視覚的および言語的トークンに注視する学習可能なクエリメカニズムをデコーダーに適用する。
- トランスフォーマー基盤の統合フレームワーク内で、オブジェクトプロポーザル生成に依存しない形で、各モジュールをエンドツーエンドに統合する。
実験結果
リサーチクエスチョン
- RQ1視覚的言語的検証は、視覚的グランドイングにおいて、言語クエリに関連する視覚的特徴の関連性を向上させることができるか?
- RQ2言語に従う文脈統合は、複雑なシーンにおけるターゲットオブジェクトの明確さをどのように向上させるか?
- RQ3複数ステージにわたる反復的クロスモーダル推論は、単一ステージの推論を上回る性能を発揮できるか?
- RQ4提案フレームワークは、計算コストとパラメータ増加を最小限に抑えながら、最先端の性能を達成できるか?
- RQ5本モデルは、学習分布外のオープンエンドドや多様な言語表現に対しても一般化性能を示せるか?
主な発見
- 提案手法は、VGデータセットにおいて71.62%の精度を達成し、ベースラインを5.60ポイント上回り、さらに深いトランスフォーマー・エンコーダースタックでさえも上回った。
- 視覚的言語的検証モジュールは、注意可視化とターゲットオブジェクトにおける高い検証スコアを通じて、言語クエリに関連する領域に的確に焦点を当てていることが示された。
- 言語に従う文脈エンコーダーは、例えば「女の子の近くの馬」のような意味的に関連する周辺領域に注視することで、オブジェクトの明確さを向上させた。
- マルチステージデコーダーは、画像とテキスト間の整合性を段階的に精緻化することで精度を向上させ、第2段階ですでに単一ステージベースラインを大きく上回った。
- ベースラインと比較して、パラメータは5.5%、計算コストは0.71%しか増加しなかったため、高い効率性を示した。
- アブレーションスタディにより、検証モジュールと文脈エンコーダーの両方が不可欠であり、併用することで最高の性能が得られることを確認した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。