Skip to main content
QUICK REVIEW

[論文レビュー] LLA: Loss-aware Label Assignment for Dense Pedestrian Detection

Zheng Ge, Jianfeng Wang|arXiv (Cornell University)|Jan 12, 2021
Advanced Neural Network Applications参考文献 39被引用数 9
ひとこと要約

本稿では、一貫した分類および回帰損失に基づいて陽性アノテーションを割り当てる、密度の高い歩行者検出のための新しいラベル割り当て戦略であるLLA(Loss-aware Label Assignment)を提案する。各GTボックスに対して最小の結合損失を持つアノテーションを選択することで、手作業で設計された事前知識に依存せずに検出性能を向上させ、RetinaNetおよびFCOSを用いた場合、CrowdHumanとCityPersonsの両データセットでMR(Mean Recall)をそれぞれ9.53%および5.47%改善した。

ABSTRACT

Label assignment has been widely studied in general object detection because of its great impact on detectors' performance. However, none of these works focus on label assignment in dense pedestrian detection. In this paper, we propose a simple yet effective assigning strategy called Loss-aware Label Assignment (LLA) to boost the performance of pedestrian detectors in crowd scenarios. LLA first calculates classification (cls) and regression (reg) losses between each anchor and ground-truth (GT) pair. A joint loss is then defined as the weighted summation of cls and reg losses as the assigning indicator. Finally, anchors with top K minimum joint losses for a certain GT box are assigned as its positive anchors. Anchors that are not assigned to any GT box are considered negative. Loss-aware label assignment is based on an observation that anchors with lower joint loss usually contain richer semantic information and thus can better represent their corresponding GT boxes. Experiments on CrowdHuman and CityPersons show that such a simple label assigning strategy can boost MR by 9.53% and 5.47% on two famous one-stage detectors - RetinaNet and FCOS, respectively, demonstrating the effectiveness of LLA.

研究の動機と目的

  • 高密度なオブジェクト配置と高い隠蔽状態が特徴の密度の高い歩行者検出(DPD)分野において、専用のラベル割り当て戦略が不足している問題に対処すること。
  • 隠蔽領域における特徴の不整合性が原因で、従来のIoUや幾何的中心に基づくラベル割り当てが群衆状況では失敗することを特定すること。
  • 固定された空間的・スケール的事前知識(例:FPN, ATSS, FCOS)に依存せず、モデルの予測に応じて動的に適応するラベル割り当てメカニズムを提案すること。
  • アノテーションと正例GTボックス間の結合損失を最小化することが主な割り当て基準となるように、密度の高い歩行者データセットにおける検出器性能を向上させること。

提案手法

  • 学習中に各アノテーション-GTペアについて分類(cls)損失と回帰(reg)損失を計算する。
  • アノテーションがGTボックスをどれだけ適切に表現しているかを測るため、cls損失とreg損失の重み付き和として結合損失を定義する。
  • アノテーションの中心が任意のGTボックス内に存在しない場合にペナルティを与える「アノテーション内制約」$C^{inbox}$ を導入し、空間的一致性を確保する。
  • 各GTに対して結合損失が最小の上位$K$個のアノテーションを陽性とし、それ以外のアノテーションは陰性とラベル付ける。
  • 中心やスケールに関する手作業で設計された事前知識(例:FPN, ATSS, FCOS)を完全に廃止し、モデルの予測に完全に適応可能な方法とする。
  • アノテーションベース(RetinaNet)およびアノテーションフリー(FCOS)の両検出器に適用可能であり、アーキテクチャの変更なしに利用可能である。

実験結果

リサーチクエスチョン

  • RQ1モデルの予測損失に基づくラベル割り当て戦略が、従来のIoUベースや中心に基づく割り当てよりも、密度の高い歩行者検出で優れた性能を発揮できるか?
  • RQ2損失に配慮したラベル割り当てが、隠蔽状態にある歩行者の誤分類や誤配置のエラーを低減できるか?
  • RQ3IoUブランチやGroupNormなどの追加コンponentを用いずに、LLAがCrowdHumanやCityPersonsといったベンチマークデータセットでどの程度性能向上を達成できるか?
  • RQ4ATSS や FreeAnchor といった最先端のラベル割り当て手法と比較して、LLAは隠蔽に対するロバスト性に優れているか?
  • RQ5中心に基づく監視(例:Centerness)が使用されない状況でも、LLAは高い性能を維持できるか?

主な発見

  • RetinaNetに適用した場合、LLAはCrowdHumanでMRを9.53%向上させ、すべてのベースラインラベル割り当て戦略を上回った。
  • FCOSに適用した場合、LLAはCrowdHumanでMRを5.47%向上させ、検出器アーキテクチャを越えた強い汎用性を示した。
  • CityPersonsでは、ReasonableサブセットでMRを2.22%、Heavy Occlusionサブセットで3.10%低減し、既存手法を上回った。
  • ATSSですらCenternessブランチを用いている場合でも、LLAはそれを上回り、補助的監視がなければなおさら優位性を示した。
  • 可視化結果から、トレーニング過程でLLAの陽性アノテーションがGTボックスの前面領域に移動していることが確認され、特徴の整合性が向上していることが示された。
  • IoUブランチやGroupNormといった追加コンponentを一切使用せず、単純さに裏打ちされた効果性により、最先端の性能を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。