Skip to main content
QUICK REVIEW

[論文レビュー] PSC-Net: Learning Part Spatial Co-occurrence for Occluded Pedestrian Detection

Jin Xie, Yanwei Pang|arXiv (Cornell University)|Jan 25, 2020
Advanced Neural Network Applications参考文献 55被引用数 5
ひとこと要約

PSC-Netは、歩行者の身体部位同士の相互および内部空間的関係を明示的にモデル化する新しいグラフ畳み込みネットワーク(GCN)ベースのパーツ空間的共起(PSC)モジュールを導入し、遮蔽下での検出性能を向上させた。パーツアノテーションや可視ボクシングボックス(VBB)の監視を必要とせず、CityPersons(HOセット)で先行SOTAと比較して4.0%、Caltech(HOセット)で3.1%のログ平均ミス率を低減し、最先端の性能を達成した。

ABSTRACT

Detecting pedestrians, especially under heavy occlusions, is a challenging computer vision problem with numerous real-world applications. This paper introduces a novel approach, termed as PSC-Net, for occluded pedestrian detection. The proposed PSC-Net contains a dedicated module that is designed to explicitly capture both inter and intra-part co-occurrence information of different pedestrian body parts through a Graph Convolutional Network (GCN). Both inter and intra-part co-occurrence information contribute towards improving the feature representation for handling varying level of occlusions, ranging from partial to severe occlusions. Our PSC-Net exploits the topological structure of pedestrian and does not require part-based annotations or additional visible bounding-box (VBB) information to learn part spatial co-occurrence. Comprehensive experiments are performed on two challenging datasets: CityPersons and Caltech datasets. The proposed PSC-Net achieves state-of-the-art detection performance on both. On the heavy occluded ( extbf{HO}) set of CityPerosns test set, our PSC-Net obtains an absolute gain of 4.0\% in terms of log-average miss rate over the state-of-the-art with same backbone, input scale and without using additional VBB supervision. Further, PSC-Net improves the state-of-the-art from 37.9 to 34.8 in terms of log-average miss rate on Caltech ( extbf{HO}) test set.

研究の動機と目的

  • 自動運転や監視などの実世界のシナリオにおいて、重度に遮蔽された歩行者の検出という持続的な課題に対処すること。
  • 身体部位間および部位内における空間的共起を明示的にモデル化することで、遮蔽下の歩行者の特徴表現を向上させること。
  • パーツベースのアノテーションや可視ボクシングボックス(VBB)情報に依存せずに、歩行者のトポロジカル構造を活用するモジュールを設計すること。
  • 特に重度の遮蔽下においても、標準ベンチマークで最先端の性能を達成すること。
  • 空間的共起学習が、単にパーツ検出スコアに依存するのではなく、歩行者検出のロバスト性を向上させることを実証すること。

提案手法

  • PSC-Netフレームワークは、2段階のFaster R-CNNバックボーンに、グラフ畳み込みネットワーク(GCNs)に基づく専用のパーツ空間的共起(PSC)モジュールを統合している。
  • PSCモジュールは、ノードが身体部位(例:頭部、胴体、四肢)を表し、エッジが空間的隣接関係を符号化するグラフを構築することで、空間的共起をモデル化する。
  • 部位内共起は、身体部位内の部分領域(例:頭部内の目と耳)をサブグラフ内のノードとして扱い、細分化された空間的推論を可能にする。
  • GCNはグラフ構造に沿って特徴表現を処理し、文脈的情報を統合することで、遮蔽下でも特徴のロバスト性を向上させる。
  • 学習段階では、パーツレベルのアノテーションやVBB監視を必要とせず、標準的な全身ボクシングボックスアノテーションのみを用いる。
  • PSCモジュールはRPNおよびROIヘッド段階に統合されており、共起を考慮した特徴が、候補領域の生成と分類を支援する。

実験結果

リサーチクエスチョン

  • RQ1歩行者の身体部位間および部位内における空間的共起を明示的にモデル化することで、重度の遮蔽下でも検出性能が向上するか?
  • RQ2パーツレベルのアノテーションや可視ボクシングボックス(VBB)監視を必要とせずに、GCNベースのモジュールが有効な共起パターンを学習できるか?
  • RQ3人間の身体のトポロジカル構造を組み込むことで、遮蔽下の歩行者検出におけるよりロバストな特徴表現が得られるか?
  • RQ4データ駆動型アプローチが、単にパーツ検出スコアや注目メカニズムに依存する既存手法を上回れるか?
  • RQ5提案されたPSC-Netは、遮蔽レベルが異なるCityPersonsやCaltechなど、多様なベンチマークにおいて汎用性を示せるか?

主な発見

  • CityPersons(HO)テストセットでは、PSC-Netはログ平均ミス率37.4を達成し、同じバックボーンと入力スケールで先行SOTAのMGAN [34]と比較して4.0%の絶対的改善を示した。
  • Caltech(HO)テストセットでは、ログ平均ミス率を37.9から34.8に低下させ、新たな最先端性能を樹立した。
  • VBB監視を用いなくても、PSC-NetはCityPersons(HO)セットでMGAN [34]を3.6%、Caltech(HO)セットで3.1%上回った。
  • CityPersonsのRセットおよびHOセットの両方で優れた性能を発揮し、ログ平均ミス率はそれぞれ10.6および50.2を記録し、同等の設定下でAdaptive-NMSおよびMGANを上回った。
  • 図5の定性的な結果から、PSC-NetはAR-Ped [3] や MGAN [34] よりも正確で完全な検出を生成しており、特に重度の遮蔽状況下で顕著であった。
  • アブレーションスタディにより、部位間および部位内共起モデリングの両方が性能向上に寄与していることが確認され、PSCモジュールの設計の有効性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。