Skip to main content
QUICK REVIEW

[論文レビュー] PromptDet: Towards Open-vocabulary Detection using Uncurated Images

Chengjian Feng, Yujie Zhong|arXiv (Cornell University)|Mar 30, 2022
Multimodal Machine Learning Applications被引用数 12
ひとこと要約

PromptDetは、固定されたCLIPテキストエンコーダーと領域的プロンプト学習を活用して視覚的・言語的埋め込みを整合化するスケーラブルでゼロショットのオープンボリュームオブジェクト検出フレームワークを提案する。これにより、手動のアノテーションが不要な状態で、新しいカテゴリのオブジェクト検出が可能となる。わずか0.1Mの収集済みWeb画像と大幅に削減された訓練コストで、SOTA性能を達成し、新規LVISカテゴリで21.4 APを達成した。

ABSTRACT

The goal of this work is to establish a scalable pipeline for expanding an object detector towards novel/unseen categories, using zero manual annotations. To achieve that, we make the following four contributions: (i) in pursuit of generalisation, we propose a two-stage open-vocabulary object detector, where the class-agnostic object proposals are classified with a text encoder from pre-trained visual-language model; (ii) To pair the visual latent space (of RPN box proposals) with that of the pre-trained text encoder, we propose the idea of regional prompt learning to align the textual embedding space with regional visual object features; (iii) To scale up the learning procedure towards detecting a wider spectrum of objects, we exploit the available online resource via a novel self-training framework, which allows to train the proposed detector on a large corpus of noisy uncurated web images. Lastly, (iv) to evaluate our proposed detector, termed as PromptDet, we conduct extensive experiments on the challenging LVIS and MS-COCO dataset. PromptDet shows superior performance over existing approaches with fewer additional training images and zero manual annotations whatsoever. Project page with code: https://fcjian.github.io/promptdet.

研究の動機と目的

  • 手動のアノテーションを必要とせずに、未観測の新しいカテゴリ向けのオープンボリュームオブジェクト検出を可能にすること。
  • オブジェクト検出器から得られる視覚的表現と、事前学習済みの視覚言語モデルのテキスト埋め込みとの間の分布ギャップを埋めること。
  • 自己学習を用いて、ノイズが多く収集済みのWeb画像から、より広範なオブジェクトカテゴリにスケーラブルに検出を拡張すること。
  • 高解像度の入力、広範なファインチューニング、または知識蒸留の必要性を最小限に抑えることで、訓練コストを削減すること。
  • 最小限の人的データでLVISおよびMS-COCOベンチマークでSOTA性能を達成すること。

提案手法

  • エンドツーエンドのテキストエンコーダーのファインチューニングを回避するため、固定されたCLIPテキストエンコーダーを分類器生成器として使用する2段階のオブジェクト検出器を採用する。
  • 視覚的特徴がオブジェクト中心であるのに対し、テキスト特徴が画像に依存しないという点を考慮し、領域的プロンプト学習(RPL)を導入。学習可能なプロンプトベクトルを最適化して、テキスト埋め込み空間とRPN提案からのオブジェクト中心の視覚的特徴を整合化する。
  • 更新されたプロンプトを用いてWebから候補画像を繰り返し取得し、学習用の偽ラベルを生成する自己学習フレームワークを開発する。
  • 耐性を高めるために、上位K(K=20)の信頼度の高いRPN提案を用いて偽ラベルを生成する。
  • 収集済み画像からの偽ラベルデータを用いて、視覚的バックボーンとクラスに依存しないRPNヘッドを訓練するが、テキストエンコーダーは固定したままにする。
  • 自己学習を段階的に繰り返すことで、最初は高信頼度の画像候補から始め、段階的にプロンプトと検出器を改善するカリキュラム学習戦略を採用する。

実験結果

リサーチクエスチョン

  • RQ1ファインチューニングを伴わずに、固定されたCLIPテキストエンコーダーをオープンボリュームオブジェクト検出に効果的に適応できるか?
  • RQ2視覚的特徴がオブジェクト中心であり、テキスト特徴が画像に依存しない状況で、視覚的および言語的潜在空間をどのように整合化できるか?
  • RQ3ノイズの多いデータを含む収集済みWeb画像を用いた自己学習が、ゼロショット検出性能を顕著に向上させられるか?
  • RQ4オブジェクト検出の文脈において、領域的プロンプト学習は標準的なプロンプトチューニングを上回る性能を示せるか?
  • RQ5最小限の訓練データと計算コストで、LVISおよびCOCOでSOTA性能を達成できるか?

主な発見

  • PromptDetはLVIS v1.0バリデーションセットの新規カテゴリで21.4 APを達成し、以前のSOTAであるViLD-ensを4.8 AP、Deticを3.6 AP上回った。
  • 72エポックの訓練と0.1Mの収集済みWeb画像のみで、手動でアノテートされた120万枚の画像を用いるDeticを上回った。
  • MS-COCOオープンボリュームベンチマーク(48のベースカテゴリ、17の新規カテゴリ)において、PromptDetは新規カテゴリで26.6 AP、全体で50.6 APを達成し、Detic(24.1および44.7 AP)を上回った。
  • 上位20個のRPN提案を用いた自己学習が最良の性能(新規カテゴリで19.0 AP)を示したが、すべての提案を用いると性能は10.4 APに低下した。
  • CLIPテキストエンコーダーを固定し、視覚的バックボーンとRPNのみをファインチューニングした場合、新規カテゴリ検出で1.8 APの低下が生じた。これは、プロンプトベースの適応の重要性を示している。
  • 72エポックまで訓練を延長したことで、共通カテゴリと頻度の高いカテゴリの性能が、それぞれ18.5 APから23.3 AP、25.8 APから29.3 APに向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。