Skip to main content
QUICK REVIEW

[論文レビュー] A Deeply-Recursive Convolutional Network for Crowd Counting

Xinghao Ding, Zhi-Rui Lin|arXiv (Cornell University)|May 15, 2018
Video Surveillance and Tracking Methods被引用数 16
ひとこと要約

本稿では、残差ブロックを再帰的に再利用することで、パラメータ数をたった0.028百万に抑える、集団計数のための深く再帰的な残差ネットワークであるDR-ResNetを提案する。これにより、最先端のモデルと比較して500倍以上も少ないパラメータ数で高い精度を維持する。本手法はShanghaiTechおよびUCF_CC_50で最先端の性能を達成し、実世界の北京BRTデータセットにおいても優れた結果を示し、実際の監視環境における明るさの変動、影、スケール変化に対して強い耐性を示している。

ABSTRACT

The estimation of crowd count in images has a wide range of applications such as video surveillance, traffic monitoring, public safety and urban planning. Recently, the convolutional neural network (CNN) based approaches have been shown to be more effective in crowd counting than traditional methods that use handcrafted features. However, the existing CNN-based methods still suffer from large number of parameters and large storage space, which require high storage and computing resources and thus limit the real-world application. Consequently, we propose a deeply-recursive network (DR-ResNet) based on ResNet blocks for crowd counting. The recursive structure makes the network deeper while keeping the number of parameters unchanged, which enhances network capability to capture statistical regularities in the context of the crowd. Besides, we generate a new dataset from the video-monitoring data of Beijing bus station. Experimental results have demonstrated that proposed method outperforms most state-of-the-art methods with far less number of parameters.

研究の動機と目的

  • 既存のCNNベースの集団計数モデルが要求する高い計算コストとストレージ要件に対処すること、特にリソース制限のある組み込みデバイスへのデプロイを念頭に置いたもの。
  • パラメータ数を削減しても性能を維持できる、軽量かつ高精度な集団計数モデルの開発。
  • 明るさの変動、影、グレアといった実世界の厳しい条件を伴う、インテリジェント輸送応用を目的とした、新たな現実的でリアルなデータセット「Beijing BRT」の導入。
  • 残差ブロックの再帰的再利用が、パラメータ数を増やさずにネットワークの深さを増すことができ、特徴抽出能と一般化性能を向上させることの有効性の検証。
  • スパarsely、密集、実世界のシーンを含む多様なデータセットにおけるモデルの耐性の検証。

提案手法

  • 提案されたDR-ResNetは、同じ残差ブロックを複数回再利用することで、パラメータ数を増やさずにネットワークの深さを向上させる再帰的残差ブロックアーキテクチャを採用する。
  • 各残差ブロックは、バッチ正則化とReLU活性化関数を介して接続された2つの畳み込み層から構成される。
  • 2番目の残差モジュールにおいて、再帰的レイヤー間で重み共有を実施することで、パラメータ効率を維持しながら有効な深さを増している。
  • 密度マップは、密集した集団には幾何学的適応型ガウスカーネル、スパarselyなシーンには固定サイズのカーネルを用いることで、局所化の精度を向上させる。
  • 予測された密度マップの積分により集団数を推定し、式 $ F(x) = \sum_{i=1}^{N} \delta(x - x_i) * G_{\sigma_i} $ を用いる。ここで $ \sigma_i = \beta \bar{d}_i $ であり、$ \beta = 0.3 $ である。
  • ShanghaiTechデータセットのトレーニング多様性向上のため、ランダムクロッピングおよび水平反転によるデータ拡張を実施している。

実験結果

リサーチクエスチョン

  • RQ1再帰的残差ネットワークアーキテクチャは、既存のモデルと比較して顕著に少ないパラメータ数で高い集団計数精度を達成できるか?
  • RQ2グレア、影、変動する照明といった厳しい視覚的条件を伴う実世界の監視データに対して、提案されたDR-ResNetはどのように性能を発揮するか?
  • RQ3再帰的設計は、モデル複雑度を増やさずにマルチスケールおよび文脈的特徴を効果的に捉えることができるか?
  • RQ4ShanghaiTechおよびUCF_CC_50といったベンチマークデータセットにおいて、DR-ResNetの性能は最先端のモデルと比べてどうか?
  • RQ5新規に提案された北京BRTデータセットは、インテリジェント輸送応用のためのより現実的でリアルな評価ベンチマークを提供できるか?

主な発見

  • 北京BRTデータセットにおいて、DR-ResNetは平均絶対誤差(MAE)1.39、平均二乗誤差(MSE)2.00を達成し、MCNN(MAE: 2.24、MSE: 3.35)およびFCN(MAE: 1.74、MSE: 2.43)を上回る性能を示した。
  • ShanghaiTech Part_Bデータセットでは、DR-ResNetはMAE 124.2、MSE 21.0を達成し、ResNet-14(MAE: 137.1、MSE: 27.8)を上回り、一部の設定ではCP-CNNよりも耐性が高かった。
  • わずか0.028百万のパラメータしか持たないにもかかわらず、Switch-CNN(15.1M)やCP-CNN(62.9M)といった1500万以上のパラメータを持つモデルと同等またはそれ以上の性能を達成した。
  • UCF_CC_50データセットにおいても、DR-ResNetは高い一般化性能を示し、MAEが21.0であったが、CP-CNN(MAE: 20.1)のみがこれより低いMAEを記録しており、極端なスケールおよびサイズの変化に強く耐性があることが示された。
  • 提案された北京BRTデータセットは、1,280枚の画像と16,795人のラベル付き歩行者を含み、実世界の視覚的課題を伴うインテリジェント輸送応用のための現実的でリアルなベンチマークを提供している。
  • 可視化結果から、DR-ResNetは影やグレアがある複雑なシーンでも正確に集団数を推定できており、テスト画像では正解値と推定値が近接している(例:32 vs. 34、62 vs. 59)ことが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。