Skip to main content
QUICK REVIEW

[論文レビュー] MRCNet: Crowd Counting and Density Map Estimation in Aerial and Ground Imagery

Reza Bahmanyar, Eleonora Vig|arXiv (Cornell University)|Sep 27, 2019
Video Surveillance and Tracking Methods参考文献 25被引用数 22
ひとこと要約

本稿では、空中および地上画像における正確な混雑度数え上げと高解像度密度マップ推定を目的とした、マルチスケールエンコーダ・デコーダ畳み込みニューラルネットワーク(MRCNet)を提案する。FPNにインspiredされたラテラル接続を用いてVGG-16特徴を活用し、2段階の損失関数を最適化することで、新規のDLR-ACD空中混雑度データセットおよびShanghaiTech CCTVベンチマークの両方で最先端性能を達成し、平均絶対誤差およびF1スコアの新しいSOTA結果を設定した。

ABSTRACT

In spite of the many advantages of aerial imagery for crowd monitoring and management at mass events, datasets of aerial images of crowds are still lacking in the field. As a remedy, in this work we introduce a novel crowd dataset, the DLR Aerial Crowd Dataset (DLR-ACD), which is composed of 33 large aerial images acquired from 16 flight campaigns over mass events with 226,291 persons annotated. To the best of our knowledge, DLR-ACD is the first aerial crowd dataset and will be released publicly. To tackle the problem of accurate crowd counting and density map estimation in aerial images of crowds, this work also proposes a new encoder-decoder convolutional neural network, the so-called Multi-Resolution Crowd Network MRCNet. The encoder is based on the VGG-16 network and the decoder is composed of a set of bilinear upsampling and convolutional layers. Using two losses, one at an earlier level and another at the last level of the decoder, MRCNet estimates crowd counts and high-resolution crowd density maps as two different but interrelated tasks. In addition, MRCNet utilizes contextual and detailed local information by combining high- and low-level features through a number of lateral connections inspired by the Feature Pyramid Network (FPN) technique. We evaluated MRCNet on the proposed DLR-ACD dataset as well as on the ShanghaiTech dataset, a CCTV-based crowd counting benchmark. The results demonstrate that MRCNet outperforms the state-of-the-art crowd counting methods in estimating the crowd counts and density maps for both aerial and CCTV-based images.

研究の動機と目的

  • 混雑度監視および管理分野における研究を促進するため、大規模な空中混雑度データセットの不足に対処すること。
  • 挑戦的な空中および地上画像において、正確な混雑度数え上げと高解像度密度マップ推定が可能な深層学習モデルの開発。
  • 密な混雑状況におけるスケール変動、隠蔽、低解像度の人物外観に対する耐性の向上。
  • 文脈的特徴と局所的特徴の統合を実現するマルチスケールアーキテクチャを設計することで、空中およびCCTVベースの混雑度数え上げにおける転移学習を可能にすること。
  • DLR空中混雑度データセット(DLR-ACD)をリリースし、33枚の画像にわたり226,291人のアノテーションが付与された、最初の公開可能な空中混雑度データセットを提供すること。

提案手法

  • MRCNetは、入力画像からの階層的特徴抽出のため、VGG-16に基づくエンコーダを採用する。
  • デコーダは双方向補間と畳み込み層を用い、高解像度密度マップを再構築する。
  • 2つの損失関数が適用され、中間デコーダ層と最終出力層の両方で、混雑度数え上げと密度マップ品質の両方を共同最適化する。
  • エンコーダとデコーダの特徴マップ間のラテラルスキップ接続は、要素ごとの加算を用い、特徴マップの統合を実現する。これは、特徴ピラミッドネットワーク(FPN)にインspiredされたものである。
  • 一般化性能を向上させるために、ランダムクロッピング、回転、反転、スケーリングを含むデータ拡張を用いて、エンド・ツー・エンドでネットワークを訓練する。
  • クロスドメインの転移性を評価するため、提案されたDLR-ACDデータセットおよび標準のShanghaiTechベンチマークの両方でモデルを評価する。

実験結果

リサーチクエスチョン

  • RQ1深層学習モデルは、空中およびCCTVベースの画像の両方で、混雑度数え上げと密度マップ推定において最先端の性能を達成できるか?
  • RQ2ラテラル接続によるマルチスケール特徴統合は、小さな物体および密集した物体の精度向上にどの程度効果的か?
  • RQ3空中画像で学習したモデルが地上ベースの監視データにどの程度一般化可能か、逆に地上データから空中データに一般化可能か?
  • RQ4提案された2段階損失戦略は、単一損失アプローチと比較して、数え上げ推定と密度マップ品質の両方を改善するか?
  • RQ5新規の大規模な空中混雑度データセットは、空中混雑度分析分野における研究を顕著に前進させ得るか?

主な発見

  • DLR-ACDデータセットでは、MRCNetが最も低い平均正規化絶対誤差(MNAE)0.21を達成し、すべてのベースラインを上回った。
  • 推定密度マップからの人物検出において、MRCNetはF1スコア0.49を達成し、比較されたすべての手法の中で最高であった。
  • ShanghaiTech Part-Aベンチマークでは、MRCNetが平均絶対誤差(MAE)66.2を達成し、すべての最先端手法の中で最低であった。
  • ShanghaiTech Part-Aでは、RMSEが102.0に達し、これも報告済みの最高結果であった。これは、優れた数え上げ推定精度を示している。
  • モデルの推論時間は、1枚の256×256画像ピースあたり0.03 msであり、2030万パラメータを有しながらも、高い効率性を示している。
  • 定性的な結果から、MRCNetは密集および希薄な混雑状況の両方において、高解像度かつ正確な密度マップを生成しているが、背景のゴミダミングのため一部の小さな物体が見逃されている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。