[論文レビュー] Overcoming Classifier Imbalance for Long-tail Object Detection with Balanced Group Softmax
本稿では、長尾物体検出における分類器のアンバランスを軽減するために、類似したインスタンス数を持つカテゴリをグループ化し、グループ単位でソフトマックス交差エントロピー損失を適用する新しいモジュール、Balanced Group Softmax (BAGS) を提案する。追加のサンプリングを伴わずに、ヘッドクラスとテイルクラス間のトレーニングダイナミクスを暗黙的にバランスさせるBAGSは、COCO-LTでmAPを2%以上向上させ、LVISでは新たなSOTAを樹立し、先行手法やLVIS 2019の優勝者を大きく上回る性能を示した。
Solving long-tail large vocabulary object detection with deep learning based models is a challenging and demanding task, which is however under-explored.In this work, we provide the first systematic analysis on the underperformance of state-of-the-art models in front of long-tail distribution. We find existing detection methods are unable to model few-shot classes when the dataset is extremely skewed, which can result in classifier imbalance in terms of parameter magnitude. Directly adapting long-tail classification models to detection frameworks can not solve this problem due to the intrinsic difference between detection and classification.In this work, we propose a novel balanced group softmax (BAGS) module for balancing the classifiers within the detection frameworks through group-wise training. It implicitly modulates the training process for the head and tail classes and ensures they are both sufficiently trained, without requiring any extra sampling for the instances from the tail classes.Extensive experiments on the very recent long-tail large vocabulary object recognition benchmark LVIS show that our proposed BAGS significantly improves the performance of detectors with various backbones and frameworks on both object detection and instance segmentation. It beats all state-of-the-art methods transferred from long-tail image classification and establishes new state-of-the-art.Code is available at https://github.com/FishYuLi/BalancedGroupSoftmax.
研究の動機と目的
- COCOなどのバランスの取れたデータセットで優れた性能を示す最先端の検出器が、LVISのような長尾データセットで劣悪な性能を示す根本的原因を体系的に分析すること。
- 分類器のアンバランス—分類ヘッドにおけるパrameterの大きさの不均衡に起因する—が、テイルクラスの性能低下の主な要因であることを特定すること。
- 既存の長尾分類技術がアーキテクチャ的およびトレーニング上の相違により、オブジェクト検出フレームワークに直接適用された場合に失敗する理由を解明すること。
- データサンプリングや損失重み付けの変更なしに、ヘッドクラスとテイルクラスの効果的かつ統合的なトレーニングを可能にする、プラグアンドプレイ型モジュールBAGSを提案すること。
- COCO-LTという構築されたデータセットとLVISの両方において、複数のバックボーンと検出フレームワークにわたるBAGSの一般化性とロバスト性を実証すること。
提案手法
- トレーニングインスタンス数に基づいてカテゴリをグループに分け、バランスの取れたトレーニンググループを形成する。
- 各グループごとに独立してグループ単位のソフトマックス交差エントロピー損失を適用し、最適化中にヘッドクラスの支配的影響を軽減する。
- 各グループ内に「カテゴリその他の」トークンを導入し、多様なネガティブ例を提供することで、誤検出を低減する。
- バックグラウンドクラスを別グループとして扱い、強力なネガティブリファレンスとしての役割を保持する。
- 特徴抽出器を固定し、分類器の重みとバイアスのみを微調整するデカップリング戦略を用いて、分類ヘッドをBAGSでトレーニングする。
- 2段階トレーニングプロトコルを採用:まず分類ヘッドをランダム初期化からトレーニングし、その後、フルヘッドまたはバックボーンを微調整することで収束性を向上させる。
実験結果
リサーチクエスチョン
- RQ1最先端の検出器が、COCOのようなバランスの取れたデータセットで優れた性能を示す一方で、LVISのような長尾データセットで失敗するのはなぜか?
- RQ2長尾データセットにおけるデータのアンバランスが、検出ヘッドにおける分類器パrameterの大きさのアンバランスをどのように引き起こすのか?
- RQ3再重み付けや再サンプリングといった既存の長尾分類技術が、直接オブジェクト検出フレームワークに適用された場合に、なぜ効果を発揮しないのか?
- RQ4変更されたソフトマックス損失を用いたグループ単位のトレーニングは、データ拡張やサンプリングなしに、ヘッドクラスとテイルクラス間の学習を効果的にバランスさせることができるか?
- RQ5提案されたBAGSモジュールは、合成された長尾分布を含む、異なる検出アーキテクチャやデータセットに一般化可能か?
主な発見
- COCO-LTデータセットでトレーニングした場合、Faster R-CNNではmAPが2.2ポイント、Mask R-CNNでは2.4ポイント向上し、BAGSが顕著な改善を示した。
- LVISの検証セットにおいて、ResNet-50-FPNを用いたBAGSは26.25%のmAPを達成し、LVIS 2019優勝者(lvlvisis)を2.29ポイント、別の優勝者(strangeturtle)を2.35ポイント上回った。
- レアカテゴリ(AP r)では17.97%のAPを達成し、同じ指標でstrangeturtleの11.70%を大きく上回った。これは、テイルクラスの一般化性能が優れていることを示している。
- アブレーションスタディの結果、分類ヘッドのみをトレーニングするのと比較して、フルヘッドやバックボーンを微調整してもわずかな向上しか得られず、軽量なトレーニングプロトコルの有効性が裏付けられた。
- BAGSは、長尾画像分類から移植されたすべての最先端手法を上回り、装飾なしでLVISで新たなSOTAを樹立した。
- BAGSを搭載したモデルは、ヘッドクラスとテイルクラスの両方で優れた性能を維持しており、すべてのAPスコア閾値でバランスの取れた改善が得られており、分類器のアンバランスが効果的に是正されていることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。