Skip to main content
QUICK REVIEW

[論文レビュー] Reinforcing Local Feature Representation for Weakly-Supervised Dense Crowd Counting

Xiaohong Chen, Hongtao Lu|arXiv (Cornell University)|Feb 22, 2022
Video Surveillance and Tracking Methods被引用数 4
ひとこと要約

本稿では、弱教師付き密集人群計数において、グローバルな群衆数のみが利用可能な状況で、局所的特徴表現を向上させるために自己適応的特徴類似度学習(SFSL)ネットワークとグローバル・ローカル一貫性(GLC)損失を提案する。不偏な特徴推定を学習し、グローバル予測とローカル予測の間の一貫性を強制することで、大幅なアノテーション作業の削減を実現しつつ、完全教師あり手法に近い性能を達成する。

ABSTRACT

Fully-supervised crowd counting is a laborious task due to the large amounts of annotations. Few works focus on weekly-supervised crowd counting, where only the global crowd numbers are available for training. The main challenge of weekly-supervised crowd counting is the lack of local supervision information. To address this problem, we propose a self-adaptive feature similarity learning (SFSL) network and a global-local consistency (GLC) loss to reinforce local feature representation. We introduce a feature vector which represents the unbiased feature estimation of persons. The network updates the feature vector self-adaptively and utilizes the feature similarity for the regression of crowd numbers. Besides, the proposed GLC loss leverages the consistency between the network estimations from global and local areas. The experimental results demonstrate that our proposed method based on different backbones narrows the gap between weakly-supervised and fully-supervised dense crowd counting.

研究の動機と目的

  • グローバルな群衆数のみが利用可能な弱教師付き人群計数における局所的監督の制限に取り組む。
  • インスタンスレベルのアノテーションが存在しない状況でも、局所的特徴の識別能を向上させる。
  • グローバルな群衆数と自己教師付きのローカル監督を活用することで、高価な手動アノテーションへの依存を低減する。
  • 群衆センシングに基づくアノテーション手法で一般的に見られるラベルのずれに対して、モデルのロバストネスを向上させる。
  • 弱教師付きと完全教師ありの人群計数手法の間の性能差を縮小する。

提案手法

  • 正例(人物)のクラスタ中心として不偏な特徴推定ベクトルを維持する自己適応的特徴類似度学習(SFSL)ネットワークを導入する。
  • 訓練中に勾配降下法を用いて特徴推定ベクトルを更新することで、人物特徴の表現を段階的に最適化する。
  • 学習済みの特徴ベクトルとバックボーン特徴の画素単位の類似度を計算し、密度推定用のソフトバイナリ分類マップを生成する。
  • 類似度マップを入力として線形回帰ヘッドに与え、最終的な群衆数を予測する。
  • グローバル予測とサブ画像からのローカル予測の一致を強制するグローバル・ローカル一貫性(GLC)損失を提案する。
  • グローバル予測を監督信号として用いて、ローカル回帰を自己教師学習的に訓練することで、最小限のアノテーションでローカル特徴学習を向上させる。

実験結果

リサーチクエスチョン

  • RQ1インスタンスレベルのアノテーションが存在しない弱教師付き人群計数において、局所的特徴表現を効果的に強化できるか?
  • RQ2どのようにしてグローバルな群衆数を活用し、ローカル領域の予測を監督することで特徴の識別能を向上させられるか?
  • RQ3自動アノテーション手法で一般的に見られるラベルのずれに対して、モデルがどれほど精度を維持できるか?
  • RQ4性能とアノテーション効率の観点から、提案手法は完全教師ありベースラインと比べてどの程度の差があるか?
  • RQ5異なるバックボーンを用いても、多様な群衆密度、視点、オブジェクトスケールに一般化可能か?

主な発見

  • 提案手法は4つの人群計数データセットで競争力ある性能を達成し、弱教師ありと完全教師あり手法の間の性能差を顕著に縮小した。
  • CNNバックボーンを用いた場合、ShanghaiTech Part Aデータセットで平均絶対誤差(MAE)が12.8に達し、完全教師ありベースラインに近い性能を示した。
  • ラベルノイズに対して強いロバストネスを示した:ガウスノイズの標準偏差がσ=0.1に達しても、MAEは3.5%、MSEは0.9%しか増加しなかった。
  • パッチ単位のラベル(6倍のアノテーション量)で学習した場合、性能が著しく向上したため、より多くのグローバルラベルがさらなる向上をもたらす可能性を示した。
  • 異なるバックボーン(CNNおよびビジョントランスフォーマー(ViT))に対しても一般化可能であり、広範な適用可能性を示した。
  • GLC損失は、明示的なローカル監督がなくても、グローバル予測とローカル予測の一貫性を強制することで、ローカル特徴学習を効果的に向上させた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。