[論文レビュー] Multi-modal Queried Object Detection in the Wild
MQ-Detは、視覚的例示とテキストクエリをゲーテッドクラススケーラブルなパーセーバーモジュールを介して統合することで、言語クエリ対象検出器を強化する、プラグアンドプレイかつ効率的なマルチモーダルクエリ対象検出フレームワークを提案する。視覚条件下のマスクド言語予測を導入することで、微調整なしにLVISで+7.8% AP、13のフェイシュットタスクで平均+6.3% APを達成し、GLIPの事前学習時間のわずか3%で実現した。
We introduce MQ-Det, an efficient architecture and pre-training strategy design to utilize both textual description with open-set generalization and visual exemplars with rich description granularity as category queries, namely, Multi-modal Queried object Detection, for real-world detection with both open-vocabulary categories and various granularity. MQ-Det incorporates vision queries into existing well-established language-queried-only detectors. A plug-and-play gated class-scalable perceiver module upon the frozen detector is proposed to augment category text with class-wise visual information. To address the learning inertia problem brought by the frozen detector, a vision conditioned masked language prediction strategy is proposed. MQ-Det's simple yet effective architecture and training strategy design is compatible with most language-queried object detectors, thus yielding versatile applications. Experimental results demonstrate that multi-modal queries largely boost open-world detection. For instance, MQ-Det significantly improves the state-of-the-art open-set detector GLIP by +7.8% AP on the LVIS benchmark via multi-modal queries without any downstream finetuning, and averagely +6.3% AP on 13 few-shot downstream tasks, with merely additional 3% modulating time required by GLIP. Code is available at https://github.com/YifanXu74/MQ-Det.
研究の動機と目的
- オープンボリューム対象検出におけるテキストのみのクエリによる記述の粒度の制限を解消すること。
- 深刻な忘却や大量の再トレーニングを伴わずに、視覚的例示を用いた詳細な認識を可能にすること。
- 凍結された基盤検出器の一般化性能を保持する、プラグアンドプレイかつ効率的な調整戦略を開発すること。
- 共同テキストおよび画像クエリを用いて、強力なフェイシュットおよびゼロショット検出性能を達成すること。
- 視覚的クエリによる調整における学習の慣性を克服するため、視覚条件下のマスクド言語予測を導入すること。
提案手法
- テキストエンコーダーの各ハイレベル段階で、クラスごとのクロスアテンションを適用して視覚的インプットをテキスト埋め込みに統合する、ゲーテッドクラススケーラブルパーセーバー(GCP)モジュールを導入する。
- 視覚的クエリの品質に応じて融合を調整する条件付きゲーティング機構を用い、視覚的詳細の適応的統合を可能にする。
- 初期一般化性能を保持しつつ、テキスト埋め込み空間での摂動を許容する、リラクサントなリサイクル接続を適用する。
- 調整段階で視覚的条件下のマスクド言語予測戦略を採用する:ランダムにテキストトークンをマスクし、視覚的クエリが独立してオブジェクトクラスを予測するように強制する。
- 元の検出バックボーンを凍結し、GCPモジュールのみを微調整することで、計算コストを最小限に抑え、深刻な忘却を回避する。
- 5つの視覚的例示とそれに該当するテキスト記述を1クラスあたり用いて、Objects365でモデルを学習し、強力なゼロショット一般化性能を達成する。
実験結果
リサーチクエスチョン
- RQ1テキスト+視覚的例示のマルチモーダルクエリは、テキストのみのクエリを上回るオープンボリューム対象検出性能を顕著に向上させることができるか?
- RQ2深刻な忘却や大量の再トレーニングを伴わずに、視覚的例示をテキストクエリと効果的に統合する方法は何か?
- RQ3凍結された基盤検出器に視覚的クエリを調整する際の学習の慣性を克服するためのトレーニング戦略は何か?
- RQ4プラグアンドプレイモジュールは、計算コストを最小限に抑えつつ、さまざまな言語クエリ対象検出器を向上させることができるか?
- RQ5共同テキストおよび画像クエリは、フェイシュットおよびオープンセットベンチマークでの性能にどの程度向上効果をもたらすか?
主な発見
- MQ-Detは、GLIP検出器の最先端性能を、ダウンストリーム微調整なしにLVISベンチマークで+7.8% AP向上させ、GLIPの事前学習時間のわずか3%で実現した。
- 13のフェイシュット検出タスクにおいて、MQ-DetはGLIPと比較して平均+6.3% APの向上を達成し、強力なフェイシュット一般化性能を示した。
- 視覚的条件下のマスクド言語予測戦略は、学習の慣性を効果的に解消し、調整段階でのより深い視覚的知識統合を可能にした。
- GCPモジュールはクラス固有のパラメータを追加せず、任意の言語クエリ対象検出器と互換性があり、広範な適用性を有する。
- 1カテゴリあたり5つの視覚的例示のみを用いても、一般化性能が強く保たれ、高いデータ効率性を示した。
- 検出器を微調整する際に凍結戦略を採用しないと、LVISで-6.0% APの低下が生じ、凍結トレーニング戦略の重要性が顕著に示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。