[論文レビュー] Class-agnostic Object Detection with Multi-modal Transformer
本論文は、画像とテキストのペairで学習されたマルチモodalビジョントランスフォーマー(MViT)を用いて、クラスに依存しないオブジェクト検出を実現する手法を提案する。自然言語クエリを活用することで、多様なドメインにわたり高品質なオブジェクト候補を生成する。主な貢献は、クラス固有の教師信号なしに、MViTが一般化されたオブジェクト局在化で最先端の性能を達成できることを示したことである。これは主に学習中に言語の構造的意味が寄与しているためであり、キャプションが削除されても依然として高い性能を維持する。これは、言語の構造が語彙的コンテンツよりも重要であることを示している。
What constitutes an object? This has been a long-standing question in computer vision. Towards this goal, numerous learning-free and learning-based approaches have been developed to score objectness. However, they generally do not scale well across new domains and novel objects. In this paper, we advocate that existing methods lack a top-down supervision signal governed by human-understandable semantics. For the first time in literature, we demonstrate that Multi-modal Vision Transformers (MViT) trained with aligned image-text pairs can effectively bridge this gap. Our extensive experiments across various domains and novel objects show the state-of-the-art performance of MViTs to localize generic objects in images. Based on the observation that existing MViTs do not include multi-scale feature processing and usually require longer training schedules, we develop an efficient MViT architecture using multi-scale deformable attention and late vision-language fusion. We show the significance of MViT proposals in a diverse range of applications including open-world object detection, salient and camouflage object detection, supervised and self-supervised detection tasks. Further, MViTs can adaptively generate proposals given a specific language query and thus offer enhanced interactability. Code: \url{https://git.io/J1HPY}.
研究の動機と目的
- クラスに依存しないオブジェクト検出の課題に取り組む。これは、ドメインや未知のオブジェクトに対してスケーラブルで汎用的な解決策が不足しているためである。
- 画像とテキストのペアで学習されたマルチモーダルビジョントランスフォーマー(MViT)が、クラス固有の教師信号なしに、効果的で汎用的なオブジェクト候補生成器として機能できるかを調査すること。
- ビジョンモデルにおける一般化されたオブジェクト概念への一般化に、言語の構造と語彙的コンテンツのどちらが寄与しているかを検討すること。
- マルチスケールの可変アテンションとラテン融合を備えた効率的で柔軟なMViTアーキテクチャ(MAVL)を設計し、オブジェクト局在化の精度を向上させること。
- MViTに基づく候補が、オープンワールド検出、顕著オブジェクト検出、自己教師型学習といった下流タスクにおいてどのように有用であるかを実証すること。
提案手法
- 本手法は、画像とキャプションのペアがアライメントされた大規模な画像・テキストデータセットで事前学習されたマルチモーダルビジョントランスフォーマー(MViT)アーキテクチャを採用する。
- マルチスケールアテンションを備えたViT(MAVL)という新規アーキテクチャは、可変アテンションを用いたマルチスケール特徴抽出と、視覚的表現と言語的表現のラテンフェーズでの融合を統合し、局在化精度の向上を図る。
- 自然言語クエリ(例:「すべてのオブジェクト」やドメイン固有の用語)をMViTに提示することで、オブジェクト候補を生成する。これにより、インタラクティブで適応可能な候補生成が可能になる。
- キャプションが学習中に削除されても、視覚的領域と対応するテキスト記述を一致させるコントラスト学習の目的関数を用いて、エンドツーエンドでモデルを訓練する。
- 言語構造の貢献を分離するために、テキスト入力を削除しながらデータローダーの構造を維持するアブレーションスタディを実施する。
- 標準的な検出ベンチマークを用いて、自然画像、衛星画像、スケッチ、絵画など複数のドメインでフレームワークを評価する。
実験結果
リサーチクエスチョン
- RQ1事前学習済みマルチモーダルビジョントランスフォーマー(MViT)は、クラス固有の教師信号なしに、クラスに依存しないオブジェクト検出で最先端の性能を達成できるか?
- RQ2一般化されたオブジェクト概念への一般化に寄与する主な要因は、言語の意味論か、言語の構造(例:系列や繰り返しパターン)か?
- RQ3マルチスケールの可変アテンションとラテン融合を備えた提案されたMAVLアーキテクチャは、標準的なMViTと比較して、オブジェクト局在化の精度をどの程度向上させるか?
- RQ4MViTが生成する候補は、オープンワールド検出、顕著オブジェクト検出、自己教師型学習といった下流タスクの性能をどの程度向上できるか?
- RQ5シンプルな自然言語クエリでプロンプトされたMViTは、ドメイン外や未知のオブジェクトカテゴリにも一般化できるか?
主な発見
- MAVLは、自然画像、衛星画像、スケッチ、絵画など多様なドメインにおいて、クラスに依存しないオブジェクト検出で最先端の性能を達成し、ボトムアップの候補生成法や標準的なMViTを上回る。
- 学習中にテキストキャプションを完全に削除しても、モデルは強力な一般化性能を維持する。これは、言語構造(例:複数回の異なる文脈での画像の再訪問)が語彙的コンテンツよりも重要であることを示している。
- アブレーションスタディの結果、言語構造(例:複数のキャプションを1枚の画像に付与し、文脈を変化させる)を保持すると、Pascal-VOCでAP50が25.5ポイント向上(16.2 → 61.6)する。
- DETRegの事前学習において、Selective Searchの代わりに上位30個のMViT候補を用いることで、自己教師型オブジェクト局在化の性能が向上し、MViT候補の質の高さが実証された。
- 顕著オブジェクトや camouflage オブジェクト検出において、タスク固有のテキストクエリを用いることで、完全に教師ありのモデルと同等の性能を達成でき、タスク固有の微調整が不要である。
- 事前学習段階で画像・キャプションペアに埋め込まれた意味的・空間的文脈のおかげで、スケッチや絵画などドメイン外や未知のオブジェクトカテゴリに対しても、効果的に一般化できる。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。