[論文レビュー] Open Vocabulary Object Detection with Proposal Mining and Prediction Equalization
この論文は、オンラインプロポーザルマイニング(OPM)によるプロポーザルレベルの視覚言語整合性の向上と、オフラインクラスワイド調整(OCA)によるベース/ノベルカテゴリ予測バイアスの低減を通じて、プロポーザルレベルの視覚言語整合性を向上させるMEDetという、オープンボリュームオブジェクト検出のためのフレームワークを提案する。MEDetは、MS COCOにおけるノベルカテゴリのmAPを29.1%から32.6%まで向上させ、LVISでは1.4%の向上を達成し、22.4%のマスクAPを達成し、洗練された視覚言語知識とバランスの取れた信頼度キャリブレーションにより、最先端の性能を示している。
Open-vocabulary object detection (OVD) aims to scale up vocabulary size to detect objects of novel categories beyond the training vocabulary. Recent work resorts to the rich knowledge in pre-trained vision-language models. However, existing methods are ineffective in proposal-level vision-language alignment. Meanwhile, the models usually suffer from confidence bias toward base categories and perform worse on novel ones. To overcome the challenges, we present MEDet, a novel and effective OVD framework with proposal mining and prediction equalization. First, we design an online proposal mining to refine the inherited vision-semantic knowledge from coarse to fine, allowing for proposal-level detection-oriented feature alignment. Second, based on causal inference theory, we introduce a class-wise backdoor adjustment to reinforce the predictions on novel categories to improve the overall OVD performance. Extensive experiments on COCO and LVIS benchmarks verify the superiority of MEDet over the competing approaches in detecting objects of novel categories, e.g., 32.6% AP50 on COCO and 22.4% mask mAP on LVIS.
研究の動機と目的
- 粗い画像レベルのキャプションアノテーションに起因する、オープンボリュームオブジェクト検出(OVD)における正確なプロポーザルレベルの視覚言語整合性の欠如に対処する。
- 微調整中のクラスインバランスとカオス的フォールドバックに起因する、OVDモデルにおけるベースカテゴリに偏った予測バイアスを克服する。
- 非構造化された画像キャプションを用いてプロポーザルレベルでの視覚言語知識を精錬することで、ノベルカテゴリの検出性能を向上させる。
- 学習可能なオフラインキャリブレーション機構を通じて、ベースカテゴリとノベルカテゴリの両方における信頼度予測のより信頼性が高くバランスの取れたものにする。
- エンドツーエンドのプロポーザルマイニングと信頼度等価化を統合することで、COCOおよびLVISベンチマークで最先端の性能を達成する。
提案手法
- 画像キャプションテキストを活用して微細なプロポーザルコンセプトを抽出することで、視覚言語整合性を精錬する三段階の粗〜細のエンドツーエンドフレームワークであるオンラインプロポーザルマイニング(OPM)を提案する。
- 画像とテキスト埋め込み間のクロスアテンションを用いて、テキスト埋め込みの識別性を向上させ、より正確なプロポーザルコンセプトペアを生成する。
- 類似度エントロピーとIoUベースのフィルタリングを適用してノイズの多いプロポーザルを除去し、断片化されたものを統合することで、整合性の質を向上させる。
- 予測スコアの再重み付けを学習するカテゴリ固有バイアスベクトルを導入する、オフラインクラスワイド調整(OCA)という、微調整後のキャリブレーション手法を提案する。
- カテゴリごとの予測AP/AR性能と実際の性能の乖離を最小化する微分可能な損失関数を用いて、バイアスベクトルβを最適化する。
- 再トレーニングを必要とせず、OVR-CNNやDeticなどの異なるOVDモデル間で学習済みのバイアスベクトルβを再利用可能にすることで、移譲性と再現可能性を実現する。
実験結果
リサーチクエスチョン
- RQ1画像キャプションからのオンラインでエンドツーエンドのプロポーザルマイニングは、オープンボリュームオブジェクト検出におけるプロポーザルレベルの視覚言語整合性を向上させ得るか?
- RQ2プロポーザルレベルでの視覚言語知識の精錬は、特にノベルカテゴリにおいて、より良い検出性能をもたらすか?
- RQ3シンプルなオフラインクラスワイド調整機構は、OVDにおけるベースカテゴリとノベルカテゴリの間の信頼度バイアスを効果的に低減できるか?
- RQ4学習済みの信頼度キャリブレーションバイアスは、同じキャプションデータセットでトレーニングされた異なるOVDモデル間でどの程度移譲可能か?
- RQ5OPMにおけるIoUしきい値やOCAにおけるγといったハイパーパrameterの変更に、提案手法の性能はどの程度感受的か?
主な発見
- MEDetは、MS COCOにおけるノベルカテゴリのmAPを29.1%から32.6%まで向上させ、前回の最先端手法比で3.5%の絶対的向上を達成した。
- LVISベンチマークでは、MEDetは22.4%のマスクAPを達成し、前回の最先端手法比で1.4%の向上を記録した。
- OCAモジュールは、複数のOVDモデルにおいてノベルカテゴリおよびベースカテゴリの両方の性能を向上させ、平均でmAPが1%以上向上した。
- OCAバイアスベクトルβは移譲可能である:OVR-CNNおよびDeticに適用した場合、再トレーニングを伴わず、それぞれmAPが3.0および1.1ポイント向上した。
- ハイパーパrameterのアブレーションでは、OCAはγに対して相対的に感受性が低く、広い範囲の値で最適性能が維持された。
- OPMのアブレーションスタディでは、全3要因(コンセプト拡張、ノイズ除去、断片統合)が性能向上に寄与しており、完全なOPMではCOCOで47.5%のmAPを達成した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。