Skip to main content
QUICK REVIEW

[論文レビュー] PS-RCNN: Detecting Secondary Human Instances in a Crowd via Primary Object Suppression

Zheng Ge, Zequn Jie|arXiv (Cornell University)|Mar 16, 2020
Video Surveillance and Tracking Methods参考文献 20被引用数 6
ひとこと要約

PS-RCNN は、可視人体インスタンスを検出・抑制することで、混雑したシーンにおける密集人体検出を向上させる二段階検出フレームワークである。主な R-CNN(P-RCNN)が可視人体インスタンスを検出し、人体形状のマスクを用いて抑制することで、二次的な R-CNN(S-RCNN)が重度に隠蔽された人体の検出が可能になる。本手法は、CrowdHuman で 2.92% の AP 向上と 4.49% のリcall向上を達成し、WiderPerson でも同程度の向上を示した。

ABSTRACT

Detecting human bodies in highly crowded scenes is a challenging problem. Two main reasons result in such a problem: 1). weak visual cues of heavily occluded instances can hardly provide sufficient information for accurate detection; 2). heavily occluded instances are easier to be suppressed by Non-Maximum-Suppression (NMS). To address these two issues, we introduce a variant of two-stage detectors called PS-RCNN. PS-RCNN first detects slightly/none occluded objects by an R-CNN module (referred as P-RCNN), and then suppress the detected instances by human-shaped masks so that the features of heavily occluded instances can stand out. After that, PS-RCNN utilizes another R-CNN module specialized in heavily occluded human detection (referred as S-RCNN) to detect the rest missed objects by P-RCNN. Final results are the ensemble of the outputs from these two R-CNNs. Moreover, we introduce a High Resolution RoI Align (HRRA) module to retain as much of fine-grained features of visible parts of the heavily occluded humans as possible. Our PS-RCNN significantly improves recall and AP by 4.49% and 2.92% respectively on CrowdHuman, compared to the baseline. Similar improvements on Widerperson are also achieved by the PS-RCNN.

研究の動機と目的

  • 弱い視覚的手がかりと NMS の抑制による性能低下が生じる混雑したシーンにおける重度に隠蔽された人体インスタンスの検出という課題に対処すること。
  • 特徴量の抑制と IoU に基づく NMS による制限により、標準的な検出器が隠蔽された人体を検出できないという限界を克服すること。
  • 誤検出数の増加を伴わずに、二次的(重度に隠蔽された)人体インスタンスの検出リコールと AP を向上させること。
  • 主(可視)および二次的(隠蔽)人体インスタンスの検出を分離し、専用の学習が可能な二重ブランチ R-CNN アーキテクチャを設計すること。
  • COCOPerson からの高品質なインスタンスマスクと High-Resolution RoI Align(HRRA)モジュールを用いて、隠蔽人体の特徴表現を向上させること。

提案手法

  • 標準的な Faster R-CNN のトレーニングを用いて、わずかにまたは完全に隠蔽されていない人体インスタンスを検出する主 R-CNN(P-RCNN)を用いる。
  • P-RCNN の検出結果から人体形状のバイナリマスクを生成し、特徴マップ上のそれらのインスタンスの特徴量を抑制することで、隠蔽された人体の特徴が顕在化するようにする。
  • 入力画像ではなく特徴マップに抑制マスクを適用することで、空間解像度を保持し、推論効率を向上させる。
  • マスク処理済みの特徴量上で二次的 R-CNN(S-RCNN)をトレーニングし、重度に隠蔽された人体インスタンスを検出する。正例候補は IoU ≥ 0.6 で定義することで、より良い局所化が可能になる。
  • 最高解像度の特徴層から微細な特徴量を抽出するために High-Resolution RoI Align(HRRA)を統合し、可視身体部の詳細を保持する。
  • COCOPerson で微調整することでマスク品質を向上させ、S-RCNN の性能を強化する。

実験結果

リサーチクエスチョン

  • RQ1可視人体と隠蔽人体の検出を分離する二段階検出器が、混雑したシーンにおけるリコールと AP の向上に寄与するか?
  • RQ2人体形状のマスクによる主人体インスタンスの抑制が、重度に隠蔽された二次的インスタンスの検出を向上させるか?
  • RQ3High-Resolution RoI Align(HRRA)は、計算コストを増加させることなく、隠蔽人体の特徴表現を向上させられるか?
  • RQ4S-RCNN における正例候補の IoU サブセット閾値の選択が、検出性能に与える影響は何か?
  • RQ5提案された PS-RCNN フレームワークは、多様な隠蔽パターンとアノテーションタイプを持つ WiderPerson のようなデータセットにも一般化可能か?

主な発見

  • PS-RCNN は、FPN を搭載したベースライン Faster R-CNN と比較して、CrowdHuman データセットで AP を 2.92% 向上させ、リコールを 4.49% 向上させた。
  • WiderPerson では、ベースライン Faster R-CNN と比較して、AP を 1.63% 向上させ、リコールを 2.01% 向上させた。
  • HRRA と COCOPerson での微調整の組み合わせにより、CrowdHuman で AP が 2.41% 向上した。これは、強化された特徴量とマスク品質の有効性を示している。
  • 特徴マップに人体形状のマスクを適用する方法は、入力画像に適用する方法と同等の性能を示し、時間効率が優れている。
  • S-RCNN は、スコア > 0.5 の高信頼度予測を多数生成しており、Soft-NMS に依存する低信頼度の重複予測とは異なり、本手法が信頼性の高い検出を実現していることを示している。
  • S-RCNN における正例候補の IoU 閾値を 0.6 に設定した場合、AP が 87.94 と最高となり、0.5 や 0.7 と比較して優れている。これは、局所化精度と候補品質の最適なバランスを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。