Skip to main content
QUICK REVIEW

[論文レビュー] Bottom Up Top Down Detection Transformers for Language Grounding in Images and Point Clouds

Ayush Jain, Nikolaos Gkanatsios|arXiv (Cornell University)|Dec 16, 2021
Multimodal Machine Learning Applications被引用数 8
ひとこと要約

本論文は、事前学習済み検出器から得られる言語、視覚的特徴、オブジェクト候補を統合的に注目することで、検出器の欠落に制約されない2次元画像および3次元点群における参照表現の定位を実現する新規なビジョン・言語モデル、BUTD-DETRを提案する。検出プロンプト、ボックス候補注目、改善されたアライメント損失を活用することで、3次元ベンチマークで最先端の性能を達成し、SR3Dで12.6%の向上、NR3Dで11.6%、ScanReferで6.3%の向上を達成した。一方で、MDETRより50%高速なトレーニングを維持し、2次元でも競争力のある性能を発揮した。

ABSTRACT

Most models tasked to ground referential utterances in 2D and 3D scenes learn to select the referred object from a pool of object proposals provided by a pre-trained detector. This is limiting because an utterance may refer to visual entities at various levels of granularity, such as the chair, the leg of the chair, or the tip of the front leg of the chair, which may be missed by the detector. We propose a language grounding model that attends on the referential utterance and on the object proposal pool computed from a pre-trained detector to decode referenced objects with a detection head, without selecting them from the pool. In this way, it is helped by powerful pre-trained object detectors without being restricted by their misses. We call our model Bottom Up Top Down DEtection TRansformers (BUTD-DETR) because it uses both language guidance (top down) and objectness guidance (bottom-up) to ground referential utterances in images and point clouds. Moreover, BUTD-DETR casts object detection as referential grounding and uses object labels as language prompts to be grounded in the visual scene, augmenting supervision for the referential grounding task in this way. The proposed model sets a new state-of-the-art across popular 3D language grounding benchmarks with significant performance gains over previous 3D approaches (12.6% on SR3D, 11.6% on NR3D and 6.3% on ScanRefer). When applied in 2D images, it performs on par with the previous state of the art. We ablate the design choices of our model and quantify their contribution to performance. Our code and checkpoints can be found at the project website https://butd-detr.github.io.

研究の動機と目的

  • 既存の言語定位モデルが事前検出されたオブジェクト候補に依存するという制限を解消すること。これは、細分化されたまたはレアなオブジェクトを逃す可能性がある。
  • 検出器が小型、部分的遮断、または希少なオブジェクトに対して失敗する3次元シーンにおいても、強力な定位を可能にすること。
  • ボトムアップなオブジェクト候補とトップダウンな言語ガイダンスを統合することで、2次元および3次元の両方で性能を向上させること。
  • オラクルボックスアノテーションへの依存を減らすために、検出プロンプトを監視信号として用いてエンドツーエンドで学習すること。
  • マルチストリームアテンションによるモodulated検出が、2次元から3次元の視覚入力へと効果的に一般化されることを示すこと。

提案手法

  • モデルは、入力言語、視覚的特徴、および事前学習済み検出器からのオブジェクト候補に注目するマルチストリームトランスフォーマー・エンコーダ・デコーダアーキテクチャを採用する。
  • 検出プロンプトの監視信号を導入し、オブジェクトカテゴリーラベルを言語プロンプトとして用いて視覚的シーンに定位させる。
  • 事前に定義された候補プールから選択するのではなく、直接バウンディングボックスを予測する検出ヘッドを採用することで、ボックスバトルネック問題を回避する。
  • ノイズの少ない定位監視を実現するため、ボックスと語句スパンのアライメント損失を改善する。
  • 計算コストを低減するため、視覚ストリームで可変アテンションを適用し、MDETRより高速なトレーニングを実現する。
  • 大規模な画像・言語データセットで検出プロンプトを用いて事前学習し、参照定位ベンチマークで微調整する。

実験結果

リサーチクエスチョン

  • RQ1事前学習済み検出器からの言語とオブジェクト候補に注目する定位モデルは、候補バトルネックに縛られないモデルを上回る性能を発揮するか?
  • RQ2検出プロンプトを監視信号として組み込むことで、3次元および2次元における定位性能はどのように向上するか?
  • RQ3オブジェクト候補への注目が、小型、遮断、希少なオブジェクトの局所化にどの程度寄与するか?
  • RQ4MDETRの設計を適切な視覚エンコーダおよびデコーダの変更を加えて、3次元点群に効果的に拡張可能か?
  • RQ5検出プロンプト、ボックスストリームアテンション、改善されたアライメント損失の各要素が、全体の性能に果たす相対的寄与度は何か?

主な発見

  • BUTD-DETRは、先行する3次元手法と比較して、SR3Dベンチマークで平均リCALLに12.6%の絶対的向上を達成した。
  • NR3Dベンチマークでは11.6%の絶対的向上を達成し、従来手法を著しく上回った。
  • ScanReferベンチマークでは、先行手法より6.3%の向上を達成し、優れた一般化性能を示した。
  • 2次元では、RefCOCO、RefCOCO+、Flickr30kで競争力のある性能を発揮し、MDETRと同等の性能を達成しながら、GPUトレーニング時間が半分未満に抑えられた。
  • アブレーションスタディの結果、検出プロンプトが2.4%の精度向上を、ボックスストリームアテンションが3.1%、対照的損失設計が追加で2.1%の精度向上を寄与した。
  • ボックス候補や検出プロンプトを一切使用しないMDETR-3Dの直接実装に対しても、顕著な性能差を示し、提案された構成要素の有効性を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。