Skip to main content
QUICK REVIEW

[論文レビュー] Divide and Grow: Capturing Huge Diversity in Crowd Images with Incrementally Growing CNN

Deepak Babu Sam, Neeraj N Sajjan|ePrints-IISc. (Indian Institute of Science Bangalore)|Jul 26, 2018
Video Surveillance and Tracking Methods参考文献 16被引用数 9
ひとこと要約

本稿では、微分訓練を用いて段階的にベースCNNをより洗錑な回帰器に分割することで、手動で定義された基準に依存せずに、特殊な混雑度数え上げ専門家を自動で学習する階層的ディープラーニングフレームワークであるIncrementally Growing CNN(IG-CNN)を提案する。この手法は、手動で定義された基準を用いずに、混雑度などの潜在的特徴を抽出することで、主要な混雑度数え上げベンチマークで最先端の精度を達成し、ベースライン手法やMoEモデルを上回る性能を発揮する。

ABSTRACT

Automated counting of people in crowd images is a challenging task. The major difficulty stems from the large diversity in the way people appear in crowds. In fact, features available for crowd discrimination largely depend on the crowd density to the extent that people are only seen as blobs in a highly dense scene. We tackle this problem with a growing CNN which can progressively increase its capacity to account for the wide variability seen in crowd scenes. Our model starts from a base CNN density regressor, which is trained in equivalence on all types of crowd images. In order to adapt with the huge diversity, we create two child regressors which are exact copies of the base CNN. A differential training procedure divides the dataset into two clusters and fine-tunes the child networks on their respective specialties. Consequently, without any hand-crafted criteria for forming specialties, the child regressors become experts on certain types of crowds. The child networks are again split recursively, creating two experts at every division. This hierarchical training leads to a CNN tree, where the child regressors are more fine experts than any of their parents. The leaf nodes are taken as the final experts and a classifier network is then trained to predict the correct specialty for a given test image patch. The proposed model achieves higher count accuracy on major crowd datasets. Further, we analyse the characteristics of specialties mined automatically by our method.

研究の動機と目的

  • 異なる密度や状態における混雑度の外見に大きなばらつきが生じるという課題に対処すること。
  • 手動で定義された基準に依存せずに、原理的でデータ駆動型の方法により特殊な混雑度数え上げモデルを構築すること。
  • データセットの複雑さに基づいて段階的なモデル容量拡張を可能にすることで、混雑度数え上げにおける回帰精度を向上させること。
  • 学習された専門家階層における自動で抽出された特徴の特性を分析すること。

提案手法

  • 全データセットで訓練されたベースCNN密度回帰器から開始し、一般の混雑度特徴を学習する。
  • ベースCNNを2つの子ネットワークに複製し、微分訓練を適用することで、データセットの同時クラスタリングと各子ネットワークのファインチューニングを実施し、特殊なサブタイプに特化した学習を実現する。
  • 各子ネットワークを再帰的に2つの新しい専門家に分割することで、各レベルで特化度が高まる階層的CNNツリーを構築する。
  • テスト時に、入力画像のパッチを学習された特徴に基づいて最も適切な専門家回帰器にルーティングする分類器を別個に訓練する。
  • 微分訓練中に、クラスタリングとファインチューニングを統合することで、専門家が明確で判別可能な特徴を学習することを保証する。
  • リーフノードが最も特化度の高い回帰器を表す多段階専門家アーキテクチャを採用し、分類器が学習した特徴に基づいてルーティングを制御する。

実験結果

リサーチクエスチョン

  • RQ1密度の閾値などの手動で定義された基準に依存せずに、ディープラーニングモデルが自動で特殊な混雑度数え上げ専門家を学習できるか?
  • RQ2階層的かつ段階的なCNNの成長は、単一モデルや平坦な混合専門家アプローチと比較して、多様な混雑度シーンにおける性能をどのように向上させるか?
  • RQ3自動で抽出された特徴は、混雑度密度や被覆パターンなどの潜在的要因とどのように相関しているか?
  • RQ4階層的訓練手順は、標準的な微分訓練やMoEモデルと比較して、より優れた特徴の判別力と低い回帰誤差をもたらすか?

主な発見

  • IG-CNNはShanghaitech Part Aデータセットで平均絶対誤差(MAE)72.5を達成し、ベースラインCNNおよび混合専門家モデルを上回る性能を発揮した。
  • オラクル損失は階層の深さとともに減少(例:レベル3で8.5)しており、特化度の向上を示唆しているが、実際のテストMAEは分類器の誤差のためわずかに上昇した。
  • 本手法は、混雑度密度と相関する特徴を効果的に抽出しており、専門家グループごとのパッチ数の分布から明らかになった。例えば、R111は平均33.7の高密度混雑度に特化している。
  • IG-CNNは混合専門者ベースライン(MAE 281.8 対 72.5)および8路微分訓練(MAE 75.1 対 72.5)を著しく上回り、優れた特化度を示した。
  • 階層的訓練プロセスは、平坦な微分訓練やMoEと比較して、より判別力の高い特徴を生成しており、最終的なMAEが低く、混雑度タイプのクラスタリングが良好であることが裏付けられた。
  • 分析により、IG-CNNが学習する特徴は任意ではなく、密度など観察可能な混雑度の特徴を反映しており、専門家は明確に異なるカウントレンジに特化していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。