Skip to main content
QUICK REVIEW

[論文レビュー] Relational Learning for Joint Head and Human Detection

Cheng Chi, Shifeng Zhang|arXiv (Cornell University)|Sep 24, 2019
Video Surveillance and Tracking Methods参考文献 39被引用数 5
ひとこと要約

本稿では、頭部と人体の間の関係的学習を活用する新しい共同検出フレームワークJointDetを提案する。頭部と身体の関係を判別するモジュール(RDM)を用いて、頭部検出における誤検出を低減し、混雑したシーンにおける人体検出の再検出を向上させる。本手法は、新たに注釈を付与した高品質なデータセットを用いて、CrowdHuman、CityPersons、Caltech-USAベンチマークで最先端の性能を達成した。

ABSTRACT

Head and human detection have been rapidly improved with the development of deep convolutional neural networks. However, these two tasks are often studied separately without considering their inherent correlation, leading to that 1) head detection is often trapped in more false positives, and 2) the performance of human detector frequently drops dramatically in crowd scenes. To handle these two issues, we present a novel joint head and human detection network, namely JointDet, which effectively detects head and human body simultaneously. Moreover, we design a head-body relationship discriminating module to perform relational learning between heads and human bodies, and leverage this learned relationship to regain the suppressed human detections and reduce head false positives. To verify the effectiveness of the proposed method, we annotate head bounding boxes of the CityPersons and Caltech-USA datasets, and conduct extensive experiments on the CrowdHuman, CityPersons and Caltech-USA datasets. As a consequence, the proposed JointDet detector achieves state-of-the-art performance on these three benchmarks. To facilitate further studies on the head and human detection problem, all new annotations, source codes and trained models will be public.

研究の動機と目的

  • 手や肘のような特徴が原因で頭部検出の誤検出率が高い問題に対処すること。
  • 非最大抑制(NMS)によって多くの有効な検出が抑圧される混雑したシーンにおける人体検出性能の向上。
  • 頭部と人体の間の固有の関係を活用して、両検出タスクの精度を向上させること。
  • 今後の研究を支援するため、頭部および人体検出用に高品質で新たに注釈を付与したデータセットを提供すること。

提案手法

  • JointDetは、単一スケール・単一アスペクト比アノテーションを用いた領域提案ネットワーク(RPN)を採用し、効率的な頭部候補を生成する。
  • 頭部候補に対して統計的頭部-身体アスペクト比を適用することで、対応する全身候補を生成し、トレーニングおよび推論を高速化する。
  • 頭部および身体の候補を処理する2つの並列されたR-CNNブランチが、初期の検出結果を出力する。
  • 頭部と身体の候補が同じ人物に属するかどうかを、特徴に基づいて分類する「頭部-身体関係判別モジュール」(RDM)を導入する。
  • RDMの出力を後処理戦略に活用し、誤検出された頭部を抑制し、NMSによって除外された人体検出を回復する。
  • 頭部と身体の間の文脈的関係を活用することで、遮蔽や混雑した状況下でも検出のロバスト性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1頭部と人体の間の関係的学習により、両タスクの検出性能を同時に向上させることができるか?
  • RQ2頭部と人体の関係性を活用することで、頭部検出における誤検出を低減できるか?
  • RQ3混雑したシーンでNMSによって抑圧された人体検出を、頭部検出を代理として効果的に回復できるか?
  • RQ4高品質で新たに注釈を付与したデータセットを用いることで、ベンチマークデータセットにおける検出性能が顕著に向上するか?

主な発見

  • 提案されたJointDetは、CrowdHuman、CityPersons、Caltech-USAデータセットで最先端の性能を達成し、既存手法を上回った。
  • Caltech-USAデータセットでは、2.95%のMR⁻²スコアを達成し、「合理的なサブセット」においてすべての先行研究を上回った。
  • 新たに再注釈を施したCaltech-USAデータセットを用いることで、FPNベースライン検出器のMR⁻²スコアは、洗練された注釈を用いた場合の4.31%から、新しい注釈で学習した場合の3.26%に低下した。これは、注釈品質の向上を示している。
  • 新しいテストセットでは、洗練された注釈を用いた場合のMR⁻²スコア16.52%が、新しい注釈で学習した場合に14.26%に低下した。これにより、新しいデータセットの品質がさらに裏付けられた。
  • RDMに基づく後処理戦略は、頭部の誤検出を効果的に低減し、混雑したシーンにおける抑制済みの人体検出を顕著に回復させた。定性的な結果からもその有効性が示された。
  • 新しい注釈には、Caltech-USA用に32,273件のトレーニングおよび1,123件のテストの正例が含まれており、元の洗練済みバージョン(16,376および912)よりも大幅に多く、より強固な評価ベンチマークを可能にした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。