Skip to main content
QUICK REVIEW

[論文レビュー] Where, What, Whether: Multi-modal Learning Meets Pedestrian Detection

Yan Luo, Chongyang Zhang|arXiv (Cornell University)|Dec 20, 2020
Video Surveillance and Tracking Methods参考文献 30被引用数 14
ひとこと要約

本論文は、W3 Netと呼ばれる、アンカー非依存の歩行者検出フレームワークを提案する。このフレームワークは検出を3つのタスクに分解する:どこ(上空視点マップを用いた局所化)、何(奥行きに従うスケール予測)、そしてどれ(共有視覚・コーパス埋め込みを用いた分類による誤検出のフィルタリング)。この手法は最先端の性能を達成し、重度の隠蔽状態のサブセットにおいて誤検出率を2倍に低減した(Citypersonsでは18.7% MRに低下、前回SOTAの49.3%から)。

ABSTRACT

Pedestrian detection benefits greatly from deep convolutional neural networks (CNNs). However, it is inherently hard for CNNs to handle situations in the presence of occlusion and scale variation. In this paper, we propose W$^3$Net, which attempts to address above challenges by decomposing the pedestrian detection task into extbf{ extit{W}}here, extbf{ extit{W}}hat and extbf{ extit{W}}hether problem directing against pedestrian localization, scale prediction and classification correspondingly. Specifically, for a pedestrian instance, we formulate its feature by three steps. i) We generate a bird view map, which is naturally free from occlusion issues, and scan all points on it to look for suitable locations for each pedestrian instance. ii) Instead of utilizing pre-fixed anchors, we model the interdependency between depth and scale aiming at generating depth-guided scales at different locations for better matching instances of different sizes. iii) We learn a latent vector shared by both visual and corpus space, by which false positives with similar vertical structure but lacking human partial features would be filtered out. We achieve state-of-the-art results on widely used datasets (Citypersons and Caltech). In particular. when evaluating on heavy occlusion subset, our results reduce MR$^{-2}$ from 49.3$\%$ to 18.7$\%$ on Citypersons, and from 45.18$\%$ to 28.33$\%$ on Caltech.

研究の動機と目的

  • 実世界のシナリオにおいて性能を阻害する、継続的な隠蔽とスケール変動の課題に対処すること。
  • 重複する提案や柔軟性に欠けるアンカー設計といったアンカーベース検出器の限界を克服するため、アンカー非依存のパラダイムを採用すること。
  • 隠蔽による可視性の損失を最小限に抑える上空視点マップを活用することで、隠蔽に対するロバストな局所化を実現すること。
  • 固定されたアンカー比を避けるために、奥行きとスケールの相関関係をモデル化し、異なる画像位置で適応的なスケールを生成することで、スケール予測の正確性を向上させること。
  • 縦方向の構造が類似した非歩行者オブジェクトによる誤検出を減らすために、分類に向けた共有視覚・コーパス表現を学習すること。

提案手法

  • 前視点画像から上空視点マップを生成し、隠蔽に強い局所化を提供することで、部分的に見えている歩行者の検出をより信頼性高く可能にする。
  • 奥行きとスケールの関係をモデル化し、異なる画像位置で奥行きに従う適応的スケールを生成することで、さまざまな歩行者サイズに対するマッチング精度を向上させる。
  • 視覚特徴と意味的コーパスの手がかり(例:頭、体、四肢)を両方ともエンコードする共有潜在ベクトル空間を導入し、隠蔽あり・なしの両方の歩行者に対して統一された表現を可能にする。
  • 検出を3つの別々のヘッドに分離する:『どこ』(局所化)、『何』(スケール予測)、および『どれ』(共有コーパス-視覚埋め込みを用いた分類)。
  • 提案生成と分類には前視点特徴を使用し、局所化とスケールには上空視点を活用することで、モダリティ間の補完的情報を最大化する。
  • マルチタスク損失を用いてエンドツーエンドで訓練し、局所化、スケール、分類の目的関数を統合するが、追加の畳み込み層や全結合層を追加せずに計算効率を維持する。

実験結果

リサーチクエスチョン

  • RQ1前視点検出のみと比較して、上空視点マップが隠蔽下でも歩行者局所化のロバスト性を顕著に向上させるか?
  • RQ2奥行きとスケールの相関関係をモデル化することで、固定アンカー比に比べてより正確で適応的なスケール予測が可能になるか?
  • RQ3共有視覚・コーパス埋め込み空間が、隠蔽あり・なしの両方の歩行者に対して特徴表現を統合的に効果的に統合できるか?
  • RQ4提案されたマルチモーダル・マルチタスクフレームワークは、Citypersons や Caltech のような困難なベンチマークにおいて、既存のアンカーベースおよびアンカー非依存検出器をどれほど上回るか?
  • RQ5マルチモーダル入力を使用しても、本手法は計算的に効率的であり、リアルタイム推論を維持できるか?

主な発見

  • Citypersonsデータセットにおいて、W3 Netは重度の隠蔽サブセットの誤検出率(MR)を、前回SOTAの49.3%から18.7%に低下させ、2倍の改善を達成した。
  • Caltechデータセットにおいて、非隠蔽(Reasonable)サブセットで3.82%のMRを達成し、OR-CNN や RepLoss を含む先行手法を上回った。
  • 小型歩行者(Farサブセット)の検出性能は、特にこれに特化したTLL手法よりも16.98%向上した。
  • 本手法は、1枚のGTX 1080Ti上で競争力ある推論速度を維持し、追加の畳み込み層や全結合層を追加せずに、最先端の精度を達成した。
  • 上空視点局所化とコーパス-視覚埋め込みの組み合わせにより、Caltechの「隠蔽」サブセットで51.05%のF1スコアを達成し、FasterRCNN+ATT や MS-CNN などの手法を上回った。
  • IoU性能が顕著に向上し、IoU > 0.5 を達成する検出の割合が高くなったことから、より高い局所化精度が得られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。