Skip to main content
QUICK REVIEW

[論文レビュー] Semantic Head Enhanced Pedestrian Detection in a Crowd

Ruiqi Lu, Huimin Ma|arXiv (Cornell University)|Nov 27, 2019
Video Surveillance and Tracking Methods参考文献 29被引用数 5
ひとこと要約

本稿では、ボディのバウンディングボックスから推定された弱教師付きアノテーションを用いて、並列なセマンティックヘッド検出器を訓練することで、遮蔽に対する耐性を高める、新しい歩行者検出フレームワークであるHead-Body Alignment Network (HBAN) を提案する。ヘッドとボディの予測の間の空間的一致性を強制するアライメント損失を導入することで、HBAN は特に重度に遮蔽された歩行者に対して、既存のパーツベースおよびマルチブランチ検出器を上回る最先端の性能を達成した。

ABSTRACT

Pedestrian detection in the crowd is a challenging task because of intra-class occlusion. More prior information is needed for the detector to be robust against it. Human head area is naturally a strong cue because of its stable appearance, visibility and relative location to body. Inspired by it, we adopt an extra branch to conduct semantic head detection in parallel with traditional body branch. Instead of manually labeling the head regions, we use weak annotations inferred directly from body boxes, which is named as `semantic head'. In this way, the head detection is formulated into using a special part of labeled box to detect the corresponding part of human body, which surprisingly improves the performance and robustness to occlusion. Moreover, the head-body alignment structure is explicitly explored by introducing Alignment Loss, which functions in a self-supervised manner. Based on these, we propose the head-body alignment net (HBAN) in this work, which aims to enhance pedestrian detection by fully utilizing the human head prior. Comprehensive evaluations are conducted to demonstrate the effectiveness of HBAN on CityPersons dataset.

研究の動機と目的

  • 混雑したシーンにおける歩行者検出におけるクラス内遮蔽の課題に対処すること。
  • 検出の耐性を高めるために、人間の頭部を安定的で可視性が高く、特徴的な特徴として活用すること。
  • 既存のボディボックスアノテーションから頭部アノテーションを推定することで、手動による頭部アノテーションを必要とせずにセマンティックヘッド検出器を訓練すること。
  • 新しい自己教師付き損失関数(AlignLoss)を用いて、ヘッドとボディの空間的アライメントを明示的にモデル化すること。
  • 構造的事前知識を用いた弱教師付きパーツ検出が、歩行者検出性能を顕著に向上させられることを示すこと。

提案手法

  • ボディボックスの上部中央領域(セマンティックヘッド領域)を対象とし、ボディバウンディングボックスから推定されたアノテーションを用いて、『セマンティックヘッド』(s-head)のための並列検出ブランチを導入する。
  • s-head検出のための特別なRPNおよびRCNNヘッドを設計し、Faster R-CNNフレームワーク内でメインのボディ検出ブランチとエンドツーエンドに同時に学習する。
  • 予測されたボディボックスが予測されたs-head領域とタイトに一致するよう促す自己教師付き損失であるAlignLossを提案する。これにより、空間的一致性が強制される。
  • 固定されたアスペクト比(0.41)と相対的位置事前知識を用いて、ボディボックスからs-headアノテーションを自動生成し、手動ラベル付けを回避する。
  • さらに一般化性能と性能を向上させるために、画像の拡大(例:1.3倍)、色の歪みなどのデータ拡張を適用する。
  • s-head検出結果を用いてボディボックスの予測を精緻化・安定化する二段階検出パイプラインを採用し、特に遮蔽状況下で有効である。

実験結果

リサーチクエスチョン

  • RQ1弱教師付きセマンティックヘッド検出器は、混雑したシーンにおける歩行者検出性能を向上させることができるか?
  • RQ2学習可能な損失関数を用いてヘッドとボディの空間的アライメントを明示的に強制することで、遮蔽に対する検出耐性が向上するか?
  • RQ3ボディボックスから推定されたアノテーションだけでも、手動ラベルなしで効果的なパーツ検出器を訓練できるか?
  • RQ4本手法は、遮蔽された歩行者に対する性能において、最先端のパーツベースおよびマルチブランチ検出器と比較してどうなるか?
  • RQ5セマンティックヘッド検出の統合は、混雑した歩行者検出における非最大抑制(NMS)の結果を改善できるか?

主な発見

  • HBAN は CityPersons のバリデーションセットで最先端の性能を達成し、HOG(R set)で10.9%、HO(R set)で47.0% のmAPを記録した。これは、既存のパーツベース手法を上回った。
  • CityPersons のテストセットでは、HO で11.26% のmAPを達成し、公開済みのすべての手法の中で最高を記録した。これは、遮蔽に対する優れた耐性を示している。
  • HO において、RepLoss や Adaptive NMS を大きく上回った。これは、重度の遮蔽下でも優れた一般化性能を示している。
  • 画像の拡大(1.3倍)を適用することで、R でmAPが1.6%、HO で1.1% 向上した。これは、データ拡張と強い相乗効果を示している。
  • 正例サンプルのフィルタリングにボディボックスのみを用いるという、より少ない監視情報で、MGAN と同等の性能を達成し、Bi-Box よりもRおよびHO両セットで優れた性能を示した。
  • 可視化比較では、HBAN は特にボディが重度に遮蔽された状況でも、よりコンパクトで正確なボックスを生成しており、ボディが見えなくてもヘッドを正常に検出できた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。