Skip to main content
QUICK REVIEW

[論文レビュー] Towards Open Vocabulary Object Detection without Human-provided Bounding Boxes

Mingfei Gao, Xing Chen|arXiv (Cornell University)|Nov 18, 2021
Multimodal Machine Learning Applications参考文献 34被引用数 7
ひとこと要約

この論文は、人間によるバウンディングボックスのアノテーションを一切用いずに、事前学習済みのビジョン・ランゲージモデルを活用して高品質な疑似バウンディングボックスラベルを生成することにより、人間アノテーションなしで訓練可能な新しいオープンボリュームオブジェクト検出フレームワークを提案する。本手法は最先端の性能を達成し、COCOの新規カテゴリでは人間アノテーションで訓練されたSOTAモデルよりも3% AP向上を達成し、同じ人間アノテーションベースラインを用いる場合、8% APの向上を示した。

ABSTRACT

Despite great progress in object detection, most existing methods are limited to a small set of object categories, due to the tremendous human effort needed for instance-level bounding-box annotation. To alleviate the problem, recent open vocabulary and zero-shot detection methods attempt to detect object categories not seen during training. However, these approaches still rely on manually provided bounding-box annotations on a set of base classes. We propose an open vocabulary detection framework that can be trained without manually provided bounding-box annotations. Our method achieves this by leveraging the localization ability of pre-trained vision-language models and generating pseudo bounding-box labels that can be used directly for training object detectors. Experimental results on COCO, PASCAL VOC, Objects365 and LVIS demonstrate the effectiveness of our method. Specifically, our method outperforms the state-of-the-arts (SOTA) that are trained using human annotated bounding-boxes by 3% AP on COCO novel categories even though our training source is not equipped with manual bounding-box labels. When utilizing the manual bounding-box labels as our baselines do, our method surpasses the SOTA largely by 8% AP.

研究の動機と目的

  • 高いアノテーションコストのため、既存のオブジェクト検出手法が限定された事前に定義されたオブジェクトカテゴリに制限されているという問題を解決すること。
  • 人間が提供するインスタンスレベルのバウンディングボックスアノテーションに依存せずに、オープンボリューム検出を可能にすること。
  • 事前学習済みビジョン・ランゲージモデルを活用して弱教師付きの疑似ボックス生成を行うトレーニングフレームワークを開発すること。
  • 手動のバウンディングボックスアノテーションが存在しないにもかかわらず、オープンボリューム検出ベンチマークで最先端の性能を達成すること。
  • 疑似アノテーションでトレーニングされたモデルが、人間アノテーション付きで訓練されたモデルと同等またはそれ以上の性能を示すことを実証すること。

提案手法

  • オブジェクトクエリの局所化に適した埋め込みを予測するために、事前学習済みビジョン・ランゲージモデルを用い、弱教師付き局所化を可能にする。
  • 複数の画像・テキストペアにわたるビジョン・ランゲージモデルのアテンションマップを集約することで、疑似バウンディングボックスラベルを生成する。
  • 人間によるアノテーションボックスを一切使用せず、生成された疑似ボックスを監視信号として用いて、標準的なオブジェクト検出器を訓練する。
  • 視覚的特徴と一致するように、疑似ボックスの品質を向上させるためにコントラスト学習の目的関数を適用する。
  • 必要に応じて、ベースクラスの少量のヒューマンアノテートボックスを用いて検出器をファインチューニングし、一般化性能を向上させる。
  • 段階的なトレーニングパイプラインを採用し、疑似ボックスの品質と検出器の性能を段階的に改善する。

実験結果

リサーチクエスチョン

  • RQ1人間によるバウンディングボックスアノテーションが一切不要な状態で、オープンボリュームオブジェクト検出を達成できるか?
  • RQ2ビジョン・ランゲージモデルから生成された疑似バウンディングボックスは、オブジェクト検出器のトレーニングにどの程度有効か?
  • RQ3疑似アノテーションでトレーニングされた検出器は、人間アノテーション付きで訓練されたSOTAモデルを上回ることができるか?
  • RQ4複数のベンチマークにおいて、本手法の性能はベースカテゴリおよび新規カテゴリの両方でSOTAと比較してどうなるか?
  • RQ5ビジョン・ランゲージモデルを用いた弱教師付き局所化が、オープンボリューム検出に与える影響は何か?

主な発見

  • 本手法は、人間によるバウンディングボックスアノテーションを一切使用していないにもかかわらず、COCOの新規カテゴリでSOTAモデル(人間アノテーションで訓練)よりも3% AP高い性能を達成した。
  • SOTAと同等の設定(つまり、人間アノテートボックスをベースラインとして使用)で評価した場合、本手法はSOTAを8% AP上回り、優れた学習効率を示した。
  • 本手法は多様なベンチマークにわたって良好な一般化性能を示し、COCO、PASCAL VOC、Objects365、LVISで強力な性能を発揮した。
  • ビジョン・ランゲージモデルから生成された疑似バウンディングボックスは、効果的な検出器トレーニングに適した高品質な監視信号を提供した。
  • 本手法は、高コストな人間アノテーションへの依存を顕著に低減しつつ、完全教師ありベースラインと同等またはそれ以上の性能を維持した。
  • 結果から、弱教師付きの疑似アノテーションが、オープンボリューム検出における人間アノテートボックスの代替として実用的で強力であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。