[論文レビュー] Detecting Twenty-thousand Classes using Image-level Supervision
Deticは、ImageNet-21Kなどの大規模データセットからの画像レベルラベルのみを用いて、最大21,000クラスのオブジェクト検出器を訓練するシンプルで効果的な手法を提案する。分類と局所化を分離し、各画像ごとに最大の提案領域に対してのみ画像レベルの監視を適用することで、開閉型検出および長尾検出ベンチマークで最先端の性能を達成し、LVISで新規クラスのmAPを8.3ポイント向上させ、レアクラスと共通クラスの性能差を解消する。
Current object detectors are limited in vocabulary size due to the small scale of detection datasets. Image classifiers, on the other hand, reason about much larger vocabularies, as their datasets are larger and easier to collect. We propose Detic, which simply trains the classifiers of a detector on image classification data and thus expands the vocabulary of detectors to tens of thousands of concepts. Unlike prior work, Detic does not need complex assignment schemes to assign image labels to boxes based on model predictions, making it much easier to implement and compatible with a range of detection architectures and backbones. Our results show that Detic yields excellent detectors even for classes without box annotations. It outperforms prior work on both open-vocabulary and long-tail detection benchmarks. Detic provides a gain of 2.4 mAP for all classes and 8.3 mAP for novel classes on the open-vocabulary LVIS benchmark. On the standard LVIS benchmark, Detic obtains 41.7 mAP when evaluated on all classes, or only rare classes, hence closing the gap in performance for object categories with few samples. For the first time, we train a detector with all the twenty-one-thousand classes of the ImageNet dataset and show that it generalizes to new datasets without finetuning. Code is available at \url{https://github.com/facebookresearch/Detic}.
研究の動機と目的
- 希少または長尾クラスのためのバウンディングボックスアノテーションの不足によって引き起こされるオブジェクト検出における語彙サイズの制限に対処すること。
- 各クラスのボックスアノテーションを必要とせず、数万クラスにわたるクラスに一般化可能な検出モデルを可能にすること。
- 分類と局所化を分離することで弱教師付き検出を簡素化し、複雑な予測ベースのラベル割り当てを回避すること。
- 大規模な画像分類データを活用することで、希少クラスおよび新規クラスの性能を向上させること。
提案手法
- Deticは、ベースクラスには標準的なボックスレベルアノテーションを、すべてのクラスにはImageNet-21Kなどの大規模データセットからの画像レベルラベルを用いて検出器を訓練する。
- ラベル割り当てに複雑なスキームを必要とせず、各画像の最大の提案領域に対してのみ分類損失を適用する。
- 局所化(ボックス監視で訓練)と分類(画像レベル監視で訓練)を分離することで、語彙拡張のスケーラビリティを実現する。
- 検出器と分類器のヘッドに共通のバックボーンを用い、分類器ヘッドは画像分類データで事前学習済みである。
- さまざまな検出アーキテクチャ(例:Mask R-CNN、DETR)およびバックボーン(例:Swin-B、ResNeXt)と互換性がある。
- 画像レベルデータとの共同学習により、特徴および分類器の学習が向上し、事前学習の進展とは直交する。
実験結果
リサーチクエスチョン
- RQ1ImageNet-21Kなどの大規模データセットからの画像レベル監視を用いることで、ボックスアノテーションなしに希少クラスおよび新規クラスの検出性能を顕著に向上させることができるか?
- RQ2予測に基づかない単純なラベル割り当て戦略(例:すべての画像ラベルを最大の提案領域に割り当てる)が、弱教師付き検出において複雑な割り当てスキームを上回る性能を示すか?
- RQ321,000クラスで訓練された検出器が、ラベル空間が不一致である新しいデータセットに対して微調整なしに一般化可能か?
- RQ4Deticの性能は、完全に教師ありのベースラインおよび先行する弱教師付き手法と比較して、オープンボリュームおよび標準LVISベンチマークでどのように異なるか?
主な発見
- 標準LVISベンチマークでは、Deticは41.7 mAPおよび41.7 mAP<sub>rare</sub>を達成し、希少クラスと共通クラスの性能差を解消した。
- オープンボリュームLVISベンチマークでは、強力なボックス監視ベースラインに対して、全クラスでmAPを2.4ポイント向上させ、新規クラスでは8.3ポイント向上させた。
- ImageNet-21Kの画像レベル監視を用いることで、Deticは完全アノテーション訓練の性能上限に達し、新規クラスで24.9 mAP<sub>novel</sub>を達成した。
- Deticは微調整なしで新しいデータセットに一般化でき、Objects365では21.5 mAP、OpenImagesでは55.2 mAP<sub>50</sub>を達成した。
- この手法は、CLIP、FastText、ランダム初期化分類器を含むさまざまなバックボーンおよび分類器に対してロバストであり、一貫した向上を示した。
- 画像レベルデータとの共同学習は、事前学習データに依存せず一貫した向上をもたらし、事前学習の進展とは直交する利点を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。