Skip to main content
QUICK REVIEW

[論文レビュー] Point in, Box out: Beyond Counting Persons in Crowds

Liu, Yuting, Mayue Shi|arXiv (Cornell University)|Apr 2, 2019
Video Surveillance and Tracking Methods参考文献 47被引用数 9
ひとこと要約

本論文は、人物検出と混雑度カウントの両方のタスクを同時に学習するための深層学習モデルを、点レベルのアノテーションのみを用いて訓練する新規手法、Point-Supervised Deep Detection Network (PSDDN) を提案する。最近接距離から頭部サイズを抽出し、局所的に制約を加えた回帰損失とカリキュラム学習を用いたオンライン疑似真値更新により、ShanghaiTech、UCF_CC_50、WiderFace、TRANCOS などの複数のベンチマークで、検出およびカウントの両タスクにおいて最先端の性能を達成する。

ABSTRACT

Modern crowd counting methods usually employ deep neural networks (DNN) to estimate crowd counts via density regression. Despite their significant improvements, the regression-based methods are incapable of providing the detection of individuals in crowds. The detection-based methods, on the other hand, have not been largely explored in recent trends of crowd counting due to the needs for expensive bounding box annotations. In this work, we instead propose a new deep detection network with only point supervision required. It can simultaneously detect the size and location of human heads and count them in crowds. We first mine useful person size information from point-level annotations and initialize the pseudo ground truth bounding boxes. An online updating scheme is introduced to refine the pseudo ground truth during training; while a locally-constrained regression loss is designed to provide additional constraints on the size of the predicted boxes in a local neighborhood. In the end, we propose a curriculum learning strategy to train the network from images of relatively accurate and easy pseudo ground truth first. Extensive experiments are conducted in both detection and counting tasks on several standard benchmarks, e.g. ShanghaiTech, UCF_CC_50, WiderFace, and TRANCOS datasets, and the results show the superiority of our method over the state-of-the-art.

研究の動機と目的

  • 回帰ベースの混雑度カウント手法が個々の人物検出を提供できないという制限を解消すること。
  • 検出ベースの手法が要求するバウンディングボックスアノテーションの高コストな問題を克服すること。
  • 人物の頭部に対して点レベルの監視情報のみを用いて、検出ネットワークのエンドツーエンド学習を可能にすること。
  • 高価なバウンディングボックスアノテーションを必要とせずに、密な群衆における局所化の正確さとサイズ推定を向上させること。
  • 本手法の一般化能力を、人物および車両のカウントタスクを含む多様なデータセットに対して示すこと。

提案手法

  • 最近接の頭部距離に基づいて、頭部の点アノテーションから疑似真値のバウンディングボックスを初期化する。
  • モデルの予測に基づいて、トレーニング中に疑似真値ボックスを更新するオンライン更新機構を実装する。
  • 局所的近傍における一貫性のあるバウンディングボックスサイズを促進する局所的制約付き回帰損失を導入し、視差歪みの影響をモデル化する。
  • 頭部距離分布に基づいて、より正確で学習が容易な疑似真値を有する画像を優先するカリキュラム学習戦略を設計する。
  • 検出ヘッドがバウンディングボックスを予測し、別個のヘッドが混雑度を推定する点監視のみを用いて、ネットワークをエンドツーエンドで学習する。
  • 局所領域におけるサイズ相関を活用し、点アノテーションのみから妥当なバウンディングボックス寸法を推定する。

実験結果

リサーチクエスチョン

  • RQ1点レベルのアノテーションのみを用いて、人物検出および混雑度カウントのための深層検出ネットワークを効果的に訓練できるか?
  • RQ2手動によるバウンディングボックスラベルなしに、疎な頭部点アノテーションから信頼性の高い疑似真値バウンディングボックスを生成する方法は何か?
  • RQ3局所的なサイズ一貫性制約が、密な群衆における検出精度をどの程度向上させられるか?
  • RQ4カリキュラム学習は、密度が著しく変動する状況において、トレーニングの安定性と性能を向上させるか?
  • RQ5提案手法は、人物カウントにとどまらず、他の検出およびカウントタスクにも一般化可能か?

主な発見

  • PSDDN は、ShanghaiTech および UCF_CC_50 データセットで最先端の回帰ベース手法と同等の混雑度カウント性能を達成する。
  • ShanghaiTech データセットにおいて、PSDDN は MAE 22.1 および MSE 70.8 を達成し、SOTA 回帰手法と同等の性能を示す。
  • 人物検出において、PSDDN は ShanghaiTech で AP 0.536 を達成し、他の点監視ベース手法を上回り、完全に監視された検出器に近い性能を示す。
  • WiderFace データセットにおいて、PSDDN は eas、medium、hard セットでそれぞれ AP 0.605、0.605、0.396 を達成し、点監視のみでも強力な一般化能力を示す。
  • TRANCOS 車両カウントデータセットにおいて、PSDDN は GAME0=4.79、GAME1=5.43、GAME2=6.68、GAME3=8.40 を達成し、高レベル指標において最良の回帰ベース手法を上回る。
  • TRANCOS における検出タスクで、PSDDN は AP 0.669 を達成し、最小限の監視情報のもとで、異なるドメイン(車両カウント)でも優れた性能を示す。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。