Skip to main content
QUICK REVIEW

[論文レビュー] Crowd Transformer Network

Viresh Ranjan, Mubarak Shah|arXiv (Cornell University)|Apr 4, 2019
Video Surveillance and Tracking Methods参考文献 12被引用数 6
ひとこと要約

本稿では、局所的な畳み込み特徴と非局所自己注意メカニズムを組み合わせることで、混雑度推定を向上させるエンドツーエンドのディーブラーニングモデルであるCrowd Transformer Network(CTN)を提案する。新規のコンテキストマルチヘッド注意モジュールを統合することで、CTNは最先端の性能を達成し、UCF-QNRFでは平均絶対誤差(MAE)を20%、UCF CCでは15%削減した。

ABSTRACT

In this paper, we tackle the problem of Crowd Counting, and present a crowd density estimation based approach for obtaining the crowd count. Most of the existing crowd counting approaches rely on local features for estimating the crowd density map. In this work, we investigate the usefulness of combining local with non-local features for crowd counting. We use convolution layers for extracting local features, and a type of self-attention mechanism for extracting non-local features. We combine the local and the non-local features, and use it for estimating crowd density map. We conduct experiments on three publicly available Crowd Counting datasets, and achieve significant improvement over the previous approaches.

研究の動機と目的

  • 畳み込みニューラルネットワークにおける局所受容野に依存する既存の混雑度カウントモデルの限界を解消すること。
  • 完全結合層を用いずに、非局所的で長距離の文脈的情報を統合することで、混雑度推定を向上させること。
  • 局所的な畳み込み特徴と非局所的注意を効果的に組み合わせることで、密な混雑画像における一般化性能を向上させるエンドツーエンドで学習可能なアーキテクチャを開発すること。
  • グローバルな依存関係を捉える新規な自己注意メカニズムを活用することで、混雑度カウントにおける平均絶対誤差(MAE)を低減すること。

提案手法

  • モデルは、入力された混雑画像から局所的な空間的特徴を抽出するために標準的な畳み込み層を用いる。
  • 特徴マップ全体にわたる非局所的で長距離の依存関係を捉えるために、コンテキストマルチヘッド注意機構を導入する。
  • 局所的特徴と非局所的特徴を連結し、共有の特徴精錬ヘッドを通過させて最終的な混雑度マップを予測する。
  • 予測された密度マップと真値密度マップのピクセル単位の回帰損失を用いて、ネットワークをエンドツーエンドで学習する。
  • コンテキストマルチヘッド注意機構は、局所受容野を超えた関連する空間的文脈に注目することで、特徴表現を向上させることを目的として設計されている。
  • モデルはUCF-QNRFデータセットで事前学習された重みを初期値とし、ShanghaitechやUCF CCなどの他のデータセットでファインチューニングされる。

実験結果

リサーチクエスチョン

  • RQ1局所的畳み込み特徴と非局所的注意メカニズムを組み合わせることで、極めて混雑な混雑画像における混雑度推定が向上するか?
  • RQ2提案されたコンテキストマルチヘッド注意機構は、混雑度カウントにおける長距離依存関係のモデリングにおいて、標準的な自己注意と比較してどのように優れているか?
  • RQ3局所的および非局所的特徴を統合するエンドツーエンドアーキテクチャは、ベンチマーク混雑度カウントデータセットにおいて、マルチステージ型やハンドクラフト特徴に基づくアプローチを上回る性能を示すか?
  • RQ4非局所的特徴の統合によって、混雑領域における誤検出(誤検出)がどの程度低減され、精度が向上するか?

主な発見

  • UCF-QNRFデータセットでは、CTNが従来の最先端手法と比較して平均絶対誤差(MAE)を20%削減した。
  • UCF CCデータセットでは、CTNが先行手法と比較してMAEを15%削減し、データセット全体にわたる一貫性のある改善を示した。
  • UCF-QNRFおよびUCF CCの両方のデータセットにおいて、CTNはすべてのベースラインを上回ったが、UCF CCのRMSEにおいてはCP-CNNを除いて優れた結果を示した。
  • Shanghaitech Part-Aデータセットでは、CTNがMAEで最良の結果を達成し、以前の最先端手法であるSANetをも上回った。
  • 定性的な分析から、CTNは局所特徴のみを用いるベースラインと比較して、混雑領域における誤検出を顕著に低減していることが示された。
  • 失敗事例においても、CTNは大多数のケースで局所特徴のみのベースラインを上回る性能を示したが、極めて高い密度を持つ画像では性能が低下した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。