Skip to main content
QUICK REVIEW

[論文レビュー] Attribute-aware Pedestrian Detection in a Crowd

Jialiang Zhang, Lixiang Lin|arXiv (Cornell University)|Oct 21, 2019
Video Surveillance and Tracking Methods参考文献 49被引用数 5
ひとこと要約

本論文は、密度や多様性といったハイレベルなセマンティック属性を埋め込み特徴マップを介してモデル化することで、混雑したシーンにおける検出性能を向上させる属性に配慮した歩行者検出器を提案する。属性に配慮した非最大抑制(NMS)と新規の正例ターゲットを統合することで、CityPersonsおよびCrowdHumanのベンチマークで最先端手法を大きく上回り、CityPersons(テストセット)では8.27%のMR⁻²、CrowdHumanでは35.76%のMR⁻²を達成した。

ABSTRACT

Pedestrian detection is an initial step to perform outdoor scene analysis, which plays an essential role in many real-world applications. Although having enjoyed the merits of deep learning frameworks from the generic object detectors, pedestrian detection is still a very challenging task due to heavy occlusion and highly crowded group. Generally, the conventional detectors are unable to differentiate individuals from each other effectively under such a dense environment. To tackle this critical problem, we propose an attribute-aware pedestrian detector to explicitly model people's semantic attributes in a high-level feature detection fashion. Besides the typical semantic features, center position, target's scale and offset, we introduce a pedestrian-oriented attribute feature to encode the high-level semantic differences among the crowd. Moreover, a novel attribute-feature-based Non-Maximum Suppression~(NMS) is proposed to distinguish the person from a highly overlapped group by adaptively rejecting the false-positive results in a very crowd settings. Furthermore, a novel ground truth target is designed to alleviate the difficulties caused by the attribute configuration and extremely class imbalance issues during training. Finally, we evaluate our proposed attribute-aware pedestrian detector on two benchmark datasets including CityPersons and CrowdHuman. The experimental results show that our approach outperforms state-of-the-art methods at a large margin on pedestrian detection.

研究の動機と目的

  • 重度の隠蔽や重なりにより個々の人物を区別することが困難な、極めて混雑したシーンにおける歩行者検出の課題に対処する。
  • 固定しきい値による処理に起因する限界を克服し、密な群衆における重複する候補領域の処理に苦労する従来のNMSの問題を解決する。
  • 密度や多様性といったセマンティック属性を、各歩行者に対して高次元の埋め込みベクトルに符号化することで、特徴表現を向上させる。
  • 属性構成に起因するクラス不均衡や学習の不安定性を軽減するため、新規の正例ターゲットを設計する。
  • セマンティック埋め込みを用いて重なりを適応的に抑制する属性に配慮したNMSを構築し、密な群衆における検出結果の精度を向上させる。

提案手法

  • 各陽性インスタンスに対して密度と多様性の両方の情報を統合した1つの埋め込みベクトルに符号化する、歩行者指向の属性マップを導入する。
  • アンカーフリー物体検出フレームワークを拡張し、各検出された歩行者に対して3次元埋め込みベクトルを予測する属性ヘッドを追加する。
  • 属性学習を促進し、クラス不均衡を是正するため、密度ラベルと多様性指標を含む新規の正例ターゲットを設計する。
  • 予測ボックスの埋め込みベクトル間のセマンティック距離を用いて、重なりが激しい誤検出を適応的に抑制する属性に配慮したNMSを提案する。
  • 分類、回帰、および属性固有の損失を含む統合損失関数を用いて、エンドツーエンドでモデルを学習する。
  • 複数スケールの特徴マップ統合を備えたDLA-34バックボーンを用い、さまざまな歩行者スケールと隠蔽レベルに対応する検出性能を向上させる。

実験結果

リサーチクエスチョン

  • RQ1密度や多様性といったハイレベルなセマンティック属性を、深層学習ベースの歩行者検出器に効果的に埋め込む方法は何か? これにより混雑したシーンにおける性能がどのように向上するか?
  • RQ2複数の歩行者が重度に隠蔽されたり重なっている状況で、従来のグリーディNMSに比べて、属性に配慮したNMSが誤検出を低減するか?
  • RQ3提案された正例ターゲット設計は、トレーニング段階における属性構成と極端なクラス不均衡の課題をどの程度軽減できるか?
  • RQ4密度と多様性の情報を1つの属性マップに統合することで、それぞれの属性に別々のブランチを設ける場合に比べて、より優れた性能が得られるか?
  • RQ5標準ベンチマークにおいて、属性に配慮した検出器は最先端手法と比較して、精度と推論速度の両面で優れているか?

主な発見

  • 提案手法はCityPersonsのテストセットで8.27%のMR⁻²を達成し、最良の競合手法(OR-CNNの11.32%)を3.05ポイント以上上回った。
  • CrowdHumanのバリデーションセットでは、属性に配慮したNMSを用いた場合、35.76%のMR⁻²を達成し、それなしのベースライン(36.79%)に比べ顕著な改善が得られた。
  • 密度と多様性を同時に埋め込む属性マップは、別々のブランチを用いる場合に比べ0.4%の性能向上を示し、マルチタスク埋め込みがデカップルドヘッドよりも有効であることを示した。
  • モデルは1枚あたり0.16秒で実行され、最近の最先端手法(ALF: 0.27秒/枚、CSP: 0.33秒/枚)よりも高速で、効率性の向上が確認された。
  • アブレーションスタディの結果、m=4が最適な埋め込み次元を示し、m=3, 4, 8の間で同等の性能を示すなど、埋め込みサイズに対して頑健であることがわかった。
  • 属性に配慮したNMSは、さまざまな設定においてグリーディNMSに比べ0.3–0.5%の性能向上を示し、重なりのある候補領域の処理における有効性を確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。