[論文レビュー] Open-Vocabulary Object Detection using Pseudo Caption Labels
本稿では、画像キャプションモデルを用いてオブジェクトインスタンスのための豊富で記述的なキャプションを生成することで、オープンボリュームオブジェクト検出を向上させるシンプルな前処理技術、偽キャプションラベル化(Pseudo Caption Labeling; PCL)を提案する。クロップされた画像に20%のマージンを追加し、オブジェクト名をプレフィックスとして付与することで、オブジェクトラベルを多様で文脈に配慮した偽キャプションに変換し、ビジョン・ランゲージモデルからの知識蒸留をより効果的に可能にする。視覚的・言語的特徴を統合したデータセットとしてのPCLは、de-duplicated VisualGenomeデータで学習した際、LVISベンチマークでAP 34.5、APr 30.6のSOTA性能を達成した。
Recent open-vocabulary detection methods aim to detect novel objects by distilling knowledge from vision-language models (VLMs) trained on a vast amount of image-text pairs. To improve the effectiveness of these methods, researchers have utilized datasets with a large vocabulary that contains a large number of object classes, under the assumption that such data will enable models to extract comprehensive knowledge on the relationships between various objects and better generalize to unseen object classes. In this study, we argue that more fine-grained labels are necessary to extract richer knowledge about novel objects, including object attributes and relationships, in addition to their names. To address this challenge, we propose a simple and effective method named Pseudo Caption Labeling (PCL), which utilizes an image captioning model to generate captions that describe object instances from diverse perspectives. The resulting pseudo caption labels offer dense samples for knowledge distillation. On the LVIS benchmark, our best model trained on the de-duplicated VisualGenome dataset achieves an AP of 34.5 and an APr of 30.6, comparable to the state-of-the-art performance. PCL's simplicity and flexibility are other notable features, as it is a straightforward pre-processing technique that can be used with any image captioning model without imposing any restrictions on model architecture or training process.
研究の動機と目的
- 単なるクラス名を超えて、新しいオブジェクトに関するより豊かな多様な知識を抽出することで、オープンボリュームオブジェクト検出を向上させること。
- 粗い手動プロンプトラベルの限界を補うために、細粒度で文脈に富んだ偽キャプションラベルを導入すること。
- モデルの学習やアーキテクチャを変更せずに、知識蒸留を強化できる、柔軟でアーキテクチャに依存しない前処理手法を開発すること。
- 偽キャプションに関係性、属性、環境的文脈を統合することで、未観測のオブジェクトクラスへの一般化を向上させること。
- 単純な前処理とキャプションモデルを用いることで、複雑なマルチデータセット学習アプローチに匹敵する性能を達成できることを示すこと。
提案手法
- PCLは、20%のマージンを含むクロップ済みオブジェクト画像と、オブジェクト名をプレフィックスとして、事前学習済みの画像キャプションモデルに供給することで、偽キャプションラベルを生成する。
- 本手法は、標準的な検出データセットを領域-キャプションデータセットに変換し、ビジョン・ランゲージモデルからの知識蒸留を可能にする。
- オブジェクト名のプレフィックス化により、生成されたすべてのキャプションが明示的にターゲットオブジェクトを言及するようになり、ラベルの一貫性が保たれる。
- 本アプローチはモジュラーであり、任意の画像キャプションモデルと互換性があり、モデルアーキテクチャや学習プロセスに変更を加える必要がない。
- 偽キャプションはオブジェクトの属性、関係性、周囲の文脈を捉え、検出器に蒸留される知識を豊かにする。
- 本手法はデータ前処理段階で適用されるため、既存のOVD学習パイプラインやモデルアーキテクチャと互換性がある。
実験結果
リサーチクエスチョン
- RQ1細粒度で文脈に富んだ偽キャプションラベルは、標準的な手動プロンプトラベルと比較して、オープンボリュームオブジェクト検出性能を向上させるか?
- RQ2偽ラベルにオブジェクトの属性、関係性、環境的文脈を組み込むことで、未学習のオブジェクトクラスへの一般化性能が向上するか?
- RQ3画像キャプションモデルを用いたラベル生成は、従来の弱教師あり学習やマルチデータセットアプローチと比較して、OVDでどのように差をつけるか?
- RQ4クロップマージン、プレフィックス化、キャプションの多様性といった設計選択肢の中で、性能に最も顕著な影響を与えるのはどれか?
- RQ5PCLのような単純な前処理技術は、アーキテクチャの変更や複雑な学習レシピなしにSOTA性能を達成できるか?
主な発見
- PCLは、de-duplicated VisualGenomeで学習した際、LVISベンチマークでAP 34.5、APr 30.6を達成し、SOTA性能を再現した。
- 学習中に手動プロンプトラベルを削除すると、性能が著しく低下した(AP -2.2、APr -2.0)、これはラベルの一貫性の重要性を示している。
- 20%のクロップマージンを採用することで文脈理解が向上し、元のバウンディングボックスを用いた場合と比較してAPrの低下を1.6ポイント低減した。
- PCLモデルは、『銀のパendantsがついた首輪をつけた猫』のような複雑な自由形式クエリにおいて優れた性能を示し、ベースラインが失敗した箇所でも主要オブジェクトを正確に検出できた。
- アブレーションスタディの結果、1オブジェクトあたり複数のキャプションを用いることと、オブジェクト名のプレフィックス化が性能向上に不可欠であることが確認された。
- 一部のキャプション生成に誤りが生じた(例:1つの例で16ラベル中7つが誤り)ものの、本手法は依然として頑健で効果的であることがわかった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。