Skip to main content
QUICK REVIEW

[論文レビュー] Revisiting Perspective Information for Efficient Crowd Counting

Miaojing Shi, Zhaohui Yang|arXiv (Cornell University)|Jul 5, 2018
Video Surveillance and Tracking Methods参考文献 53被引用数 15
ひとこと要約

この論文では、マルチスケール密度リグレッションに学習されたパースペクティブマップを統合することで、効率的な集団数え上げのためのパースペクティブに配慮した畳み込みニューラルネットワーク(PACNN)を提案する。グランドトゥルースのパースペクティブマップを生成し、それを微分可能で学習可能な重み層として使用することで、PACNNはマルチスケール密度予測を適応的に統合し、ShanghaiTech、WorldExpo’10、UCF_CC_50、UCSDのデータセットにおいて、UCSDでMAEが0.89にまで低下する最先端の精度と推論速度を達成した。

ABSTRACT

Crowd counting is the task of estimating people numbers in crowd images. Modern crowd counting methods employ deep neural networks to estimate crowd counts via crowd density regressions. A major challenge of this task lies in the perspective distortion, which results in drastic person scale change in an image. Density regression on the small person area is in general very hard. In this work, we propose a perspective-aware convolutional neural network (PACNN) for efficient crowd counting, which integrates the perspective information into density regression to provide additional knowledge of the person scale change in an image. Ground truth perspective maps are firstly generated for training; PACNN is then specifically designed to predict multi-scale perspective maps, and encode them as perspective-aware weighting layers in the network to adaptively combine the outputs of multi-scale density maps. The weights are learned at every pixel of the maps such that the final density combination is robust to the perspective distortion. We conduct extensive experiments on the ShanghaiTech, WorldExpo'10, UCF_CC_50, and UCSD datasets, and demonstrate the effectiveness and efficiency of PACNN over the state-of-the-art.

研究の動機と目的

  • 集団数え上げにおけるパースペクティブ歪みが、小規模な人物領域のスケール変動を引き起こし、正確な密度リグレッションを困難にすることに対処する。
  • 外部のカメラキャリブレーションやシーンジオメトリのアノテーションに依存せずに、効率的かつ正確な集団数え上げを可能にすること。
  • トレーニング中にエンド・トゥ・エンドでパースペクティブマップを学習し、ネットワーク内で適応的で微分可能な重み層として使用すること。
  • 人物のスケール変化を考慮したパースペクティブに配慮したアテンションを組み込むことで、マルチスケール密度マップ統合を改善すること。
  • 特にパースペクティブ歪みが強いシーンにおいて、高速な推論を実現する最先端のパフォーマンスを達成すること。

提案手法

  • 各画像ごとに人物スケール関係をサンプリングし、パースペクティブ幾何学に基づく非線形関数をフィッティングすることで、グランドトゥルースのパースペクティブマップを生成する。
  • 深層CNNを入力画像からパースペクティブマップをエンド・トゥ・エンドで予測するように訓練し、外部アノテーションが不要なテスト時の推論を可能にする。
  • 2つのパースペクティブに配慮した重み層を導入し、異なる解像度での予測されたパースペクティブマップの非線形変換により、ピクセル単位の重みを学習する。
  • これらの学習された重みを用いてマルチスケール密度マップを適応的に結合することで、最終的な密度予測がパースペクティブ歪みに対してロバストになる。
  • 一般化を向上させるために、密度リグレッションとパースペクティブマップ予測を組み合わせたマルチタスク損失でネットワークを訓練する。
  • 画像ベースの推論をサポートし、パッチベース処理を伴わずに高速な推論(例:1024×768入力で230ms)を実現できる。

実験結果

リサーチクエスチョン

  • RQ1カメラキャリブレーションやシーンジオメトリのアノテーションが不要な状況でも、パースペクティブ情報が深層ニューラルネットワークに効果的に学習され統合可能か?
  • RQ2重度のパースペクティブ歪み下でも、パースペクティブマップを学習することでマルチスケール密度統合がどのように向上するか?
  • RQ3パースペクティブに配慮した重み付け機構は、標準的なマルチスケール統合よりも精度と推論速度の両面で優れているか?
  • RQ4提案手法は、集団密度やパースペクティブ歪みが異なるさまざまなデータセットに一般化可能か?
  • RQ5パースペクティブマップの統合により、最小限の計算オーバーヘッドで最先端のパフォーマンスを達成できるか?

主な発見

  • UCSDデータセットでは、MAEが0.89、MSEが1.18にまで低下し、すべての先行手法を上回った。
  • UCF_CC_50では、[17]のバックボーンを組み合わせた場合、MAEが241.7、MSEが320.7を達成し、新たなSOTAを樹立した。
  • WorldExpo’10では、全5つのシーンで平均MAEが7.8にまで低下し、パースペクティブ変動に対して高いロバストネスを示した。
  • ShanghaiTechでは、MAEが62.4、MSEが102.0を達成し、画像ベース推論で過去のSOTAを上回った。
  • 1024×768の画像では推論時間がたったの230msで、パッチベース手法(例:5倍速い)に比べて顕著に高速だった。
  • スパarsな(UCSD)および密集した(ShanghaiTech)集団シーンを含む多様なデータセットに、良好な一般化性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。