[論文レビュー] Revisiting the Sibling Head in Object Detector
本稿では、分類と回帰ヘッドを共有領域提案からタスク固有の提案に分離することで、オブジェクト検出器における空間的不整合を著しく低減する、シンプルでありながら効果的な演算子であるタスク認識型空間的分離(TSD)を提案する。TSDは、COCOおよびOpenImagesで全バックボーンにおいてmAPを約3%向上させ、プログレッシブ制約を用いることでさらに約1%の向上を達成し、1モデルでの最先端性能(ResNet-101搭載時mAP 49.4、SENet154搭載時mAP 51.2)を達成した。
The ``shared head for classification and localization'' (sibling head), firstly denominated in Fast RCNN~\cite{girshick2015fast}, has been leading the fashion of the object detection community in the past five years. This paper provides the observation that the spatial misalignment between the two object functions in the sibling head can considerably hurt the training process, but this misalignment can be resolved by a very simple operator called task-aware spatial disentanglement (TSD). Considering the classification and regression, TSD decouples them from the spatial dimension by generating two disentangled proposals for them, which are estimated by the shared proposal. This is inspired by the natural insight that for one instance, the features in some salient area may have rich information for classification while these around the boundary may be good at bounding box regression. Surprisingly, this simple design can boost all backbones and models on both MS COCO and Google OpenImage consistently by ~3% mAP. Further, we propose a progressive constraint to enlarge the performance margin between the disentangled and the shared proposals, and gain ~1% more mAP. We show the \algname{} breaks through the upper bound of nowadays single-model detector by a large margin (mAP 49.4 with ResNet-101, 51.2 with SENet154), and is the core model of our 1st place solution on the Google OpenImage Challenge 2019.
研究の動機と目的
- オブジェクト検出器のサブヘッドにおける分類と回帰タスクの間にある本質的な空間的不整合を特定・解消すること。
- 空間次元における分類と局所化のための特徴学習を分離することで、検出性能を向上させること。
- アーキテクチャの大幅な見直しを伴わずに、2段階および1段階検出器の両方を強化できる軽量で即挿入可能なモジュールを開発すること。
- COCOおよびGoogle OpenImagesを含む多様なバックボーンとデータセットにおいて一貫した性能向上を達成すること。
- タスク固有の空間的表現を効果的に分離することで、1モデル検出器の性能上限を超えること。
提案手法
- TSDは共有領域提案$P$から分類用の$π_c$と回帰用の$π_r$という2つの分離された提案を生成し、それぞれのタスクが最適な空間領域に注目できるようにする。
- タスク認識型提案推定を用いて、分類には顕著な中心部、回帰には境界領域を適応的に選択する。
- バックボーンからの共有特徴マップを用いて両提案を生成することで、特徴の一貫性を保ちつつ空間的分離を実現する。
- 分類ヘッドと回帰ヘッドをそれぞれ独立してその分離された提案上で訓練することで、勾配伝搬における競合を低減する。
- プログレッシブ制約(PC)を導入し、分離された提案と共有された提案の性能差を広げる。分類の信頼度を高め、回帰の精度を高めるように促進する。
- 全モジュールが微分可能であり、Faster R-CNN や RetinaNet といった既存の検出器に最小限の推論オーバーヘッドでスムーズに統合可能である。
実験結果
リサーチクエスチョン
- RQ1オブジェクト検出器のサブヘッドにおける、特に分類と回帰の間の空間的不整合が性能ボトルネックを引き起こす理由は何か?
- RQ2特徴学習の空間的分離により、モデルの複雑さを増さずに検出精度を向上させることは可能か?
- RQ3タスク認識型提案推定は、異なるIoU閾値において局所化精度と分類信頼度にどのように影響を与えるか?
- RQ4TSDは、COCO や OpenImages といった大規模データセットにおいて、多様なバックボーンでどの程度の性能向上を達成できるか?
- RQ5プログレッシブ制約は空間的分離の恩恵を効果的に拡大することができ、1モデル検出器の性能限界を越えるのを可能にするか?
主な発見
- TSDは、MS COCOおよびGoogle OpenImagesの全バックボーンおよびモデルでmAPを約3%向上させ、異なるアーキテクチャ間で一貫した向上を示した。
- ResNet-101を用いたCOCO test-devでは、TSDはmAP 49.4を達成し、同じバックボーンを搭載する他のすべての1モデル検出器を上回った。
- より重いSENet154バックボーンを用いる場合、TSDはCOCO test-devでmAP 51.2を達成し、1モデルでの最先端性能を樹立した。
- 性能向上はIoU閾値が高くなるほど顕著に増大し、特にAP.75以上で優れた局所化精度を示した。
- TSDはオブジェクトサイズにかかわらず優れた一般化性能を示し、特に中型および大型オブジェクトで最大の向上が見られた。
- プログレッシブ制約はTSDの上にさらに約1%のmAP向上をもたらし、分離の恩恵を拡大する有効性を確認した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。