Skip to main content
QUICK REVIEW

[論文レビュー] Double Anchor R-CNN for Human Detection in a Crowd

Kevin Zhang, Feng Xiong|arXiv (Cornell University)|Sep 22, 2019
Video Surveillance and Tracking Methods参考文献 37被引用数 10
ひとこと要約

本稿では、ペairedなプロポーザル生成戦略を用いて、混雑したシーンにおける人体と頭部を同時に検出する二段階型オブジェクト検出フレームワーク、Double Anchor R-CNNを提案する。クロスプロポーザル増強と特徴量集約を活用し、Joint NMSモジュールを採用することで、CrowdHumanでは51.79pp、COCOPersons(混雑)では55.01pp、CrowdPose(混雑)では40.02ppのlog-average miss rateを達成し、最先端の性能を発揮。先行手法より3.57–4.24ppの向上を達成した。

ABSTRACT

Detecting human in a crowd is a challenging problem due to the uncertainties of occlusion patterns. In this paper, we propose to handle the crowd occlusion problem in human detection by leveraging the head part. Double Anchor RPN is developed to capture body and head parts in pairs. A proposal crossover strategy is introduced to generate high-quality proposals for both parts as a training augmentation. Features of coupled proposals are then aggregated efficiently to exploit the inherent relationship. Finally, a Joint NMS module is developed for robust post-processing. The proposed framework, called Double Anchor R-CNN, is able to detect the body and head for each person simultaneously in crowded scenarios. State-of-the-art results are reported on challenging human detection datasets. Our model yields log-average miss rates (MR) of 51.79pp on CrowdHuman, 55.01pp on COCOPersons~(crowded sub-dataset) and 40.02pp on CrowdPose~(crowded sub-dataset), which outperforms previous baseline detectors by 3.57pp, 3.82pp, and 4.24pp, respectively. We hope our simple and effective approach will serve as a solid baseline and help ease future research in crowded human detection.

研究の動機と目的

  • 遮蔽や重複するインスタンスの影響により検出性能が低下する混雑したシーンにおける人体検出の課題に対処すること。
  • 密集した群衆において、全身よりも遮蔽されにくく、より特徴的な頭部の情報を活用することで、検出のロバスト性を向上させること。
  • プロポーザルクロスオーバーを通じて、人体と頭部検出の両方のプロポーザル品質を向上させる訓練戦略の開発。
  • 頭部と人体の特徴量を効果的に統合するための特徴量集約メカニズムの設計。
  • 誤検出を低減し、混雑したシナリオにおける後処理のロバスト性を向上させるためのJoint NMSモジュールの導入。

提案手法

  • Double Anchor RPNは、各人物に対してペアドアンカーを用いて、同時に人体と頭部の領域プロポーザルを生成する。
  • 高品質な頭部と人体のプロポーザルをペアリングするプロポーザルクロスオーバー戦略を導入し、1枚あたりの有用な正例ペア数を約40から約97に増加させ、トレーニングを強化した。
  • 完全結合(FC)ベクトルを用いて、ペア化されたプロポーザルからの特徴量を集約し、頭部と人体間の空間的および意味的関係を活用した。
  • 2段階目の処理では、精錬された特徴量を抽出するため、RoI Pooling/RoI Alignを採用した。
  • Joint NMSモジュールは、頭部と人体の検出スコアを、学習可能な重み係数λを用いて統合し、誤検出を抑制し、後処理のロバスト性を向上させた。
  • 本手法は、CrowdHuman、COCOPersons、CrowdPoseでトレーニングおよび評価され、各コンponentの有効性を検証するためのアブレーションスタディが実施された。

実験結果

リサーチクエスチョン

  • RQ1頭部と人体の共同検出は、極めて混雑したシーンにおける性能向上に寄与するか?
  • RQ2高品質な頭部と人体のプロポーザルをペアリングするプロポーザルクロスオーバー戦略は、検出精度とロバスト性を向上させるか?
  • RQ3頭部と人体のプロポーザル間の特徴量集約は、検出の信頼性向上にどの程度効果的か?
  • RQ4頭部と人体のスコアを統合するJoint NMSモジュールは、混雑したシナリオにおいて標準NMSよりも誤検出をより効果的に低減できるか?
  • RQ5提案手法は、CrowdHumanを越える他の挑戦的な人体検出データセットに対しても一般化性を示すか?

主な発見

  • 提案されたDouble Anchor R-CNNは、CrowdHumanデータセットで51.79ppのlog-average miss rate(MR)を達成し、ベースラインより3.57ppの向上を示した。
  • COCOPersons(混雑サブデータセット)では、MRを55.01ppに低減し、ベースラインより3.82ppの改善を達成した。
  • CrowdPose(混雑サブデータセット)では、MRが40.02ppにまで低下し、ベースラインより4.24ppの向上を達成した。
  • プロポーザルクロスオーバー戦略により、1枚あたりの有効な頭部・人体プロポーザルペア数が約40から約97に増加し、検出性能が顕著に向上した。
  • FCベクトルによる特徴量集約は、MR-Bを0.45pp、MR-Hを0.14pp改善したが、空間的特徴マップの統合は、ずれのため性能が2.58pp低下した。
  • Joint NMSは、あらゆる再現率設定において誤検出を効果的に低減し、異なるλ値に対しても結果が安定しており、後処理におけるロバスト性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。