Skip to main content
QUICK REVIEW

[論文レビュー] Towards Using Count-level Weak Supervision for Crowd Counting

Yinjie Lei, Yan Liu|arXiv (Cornell University)|Feb 29, 2020
Video Surveillance and Tracking Methods参考文献 62被引用数 7
ひとこと要約

本論文は、密度マップ予測を正則化するために複数の補助ブランチを導入することで、カウントレベルのアノテーションを活用する弱教師付き集団数え上げ手法であるMultiple Auxiliary Task Training (MATT)を提案する。ブランチ間の一貫性と総数との整合性を強制することで、単純なカウント回帰ベースラインに比べて顕著な性能向上を達成し、最小限の位置レベルアノテーションで、標準的および新規に導入されたデータセットにおいて最先端の結果を達成する。

ABSTRACT

Most existing crowd counting methods require object location-level annotation, i.e., placing a dot at the center of an object. While being simpler than the bounding-box or pixel-level annotation, obtaining this annotation is still labor-intensive and time-consuming especially for images with highly crowded scenes. On the other hand, weaker annotations that only know the total count of objects can be almost effortless in many practical scenarios. Thus, it is desirable to develop a learning method that can effectively train models from count-level annotations. To this end, this paper studies the problem of weakly-supervised crowd counting which learns a model from only a small amount of location-level annotations (fully-supervised) but a large amount of count-level annotations (weakly-supervised). To perform effective training in this scenario, we observe that the direct solution of regressing the integral of density map to the object count is not sufficient and it is beneficial to introduce stronger regularizations on the predicted density map of weakly-annotated images. We devise a simple-yet-effective training strategy, namely Multiple Auxiliary Tasks Training (MATT), to construct regularizes for restricting the freedom of the generated density maps. Through extensive experiments on existing datasets and a newly proposed dataset, we validate the effectiveness of the proposed weakly-supervised method and demonstrate its superior performance over existing solutions.

研究の動機と目的

  • 位置レベルの監視にかかる高コストなアノテーションを低減するため、容易に入手可能なカウントレベルのアノテーションを活用すること。
  • カウントレベルの弱教師付き学習が、モデルの一般化性能と性能を効果的に向上させられるかどうかを調査すること。
  • カウントレベルアノテート画像から予測される密度マップを効果的に正則化する訓練戦略を設計すること。
  • 補助タスクと非対称訓練が、モデルのロバストネスと精度を向上させるかどうかを検証すること。
  • 段階的な画像追加/削除を用いて収集した新しいデータセットを公開し、カウントレベルの弱教師付き学習の評価を可能にすること。

提案手法

  • 同じ特徴マップから多様だが一貫性のある密度マップを生成するために、複数の補助予測ブランチを導入するMultiple Auxiliary Task Training (MATT)を提案する。
  • 各補助ブランチに2つの損失項を課す:(1) 予測された密度マップの積分値が正例のカウントと一致すること、(2) 異なるブランチから得られる予測密度マップが一貫性を持つこと。
  • 非対称訓練戦略を採用し、正例ブランチのみが正例アノテーションから学習する一方、補助ブランチは正例ブランチの予測とカウントラベルから学習することで、ノイズの多い勾配伝播を防ぐ。
  • 弱教師付き学習の設定を採用:一部の画像には位置レベルのアノテーション(ドットマップ)が付与されており、大多数の画像にはカウントレベルのアノテーションのみが存在する。
  • すべてのブランチで共有された特徴抽出器を用い、同じ入力画像に対して各ブランチが別個の密度マップを出力する。
  • 主ブランチでは標準的な集団数え上げ損失(例:L1またはL2)を適用し、追加のアノテーションを必要とせずに特徴学習を強化する補助監視を実装する。

実験結果

リサーチクエスチョン

  • RQ1容易に入手可能なカウントレベルのアノテーションを弱教師付き学習に活用することで、集団数え上げの性能を効果的に向上させられるか?
  • RQ2単純なカウント回帰損失は、密度マップ予測を十分に制約できず、性能が最適でない原因となっているか?
  • RQ3複数の密度マップ予測の間で一貫性を促進する補助タスクが、弱教師付きデータにおけるモデルの一般化性能を向上させられるか?
  • RQ4補助タスクが主ブランチを更新しない非対称な訓練戦略が、勾配ノイズの低減と性能向上に不可欠であるか?
  • RQ5提案手法が大規模なカウントレベルアノテートデータをどれほど活用して、完全教師ありベースラインを上回れるか?

主な発見

  • 提案されたMATT手法は、ShanghaiTech Part_Aデータセットで平均絶対誤差(MAE)80.1を達成し、単純なカウント回帰ベースライン(MAE 90.8)を顕著に上回る性能を示した。
  • 4〜6の補助ブランチを用いることで最良の性能が得られ、2つのブランチなど少ない数のブランチではベースラインを下回る結果となり、多様な監視信号の重要性が示された。
  • 非対称訓練戦略を削除すると、MAEが89.0、MSEが140.6に悪化し、補助ブランチから主ブランチへの勾配伝播を防ぐことが重要であることが裏付けられた。
  • 完全にアノテートされたデータでは、MATTは単一タスク学習(MAE 106.5)と比較して僅かに性能向上(MAE 104.6)を示すにとどまり、この手法の強みは多タスク学習そのものではなく、弱教師付き学習の活用に帰属する。
  • 新規に導入されたデータセットは、段階的な画像操作によるカウントレベルアノテーション収集が、モデル学習に有効であり、弱教師付き手法の信頼性ある評価を可能にすることを示した。
  • カウントレベル損失と補助ブランチ間の一貫性損失を併用することで最良の性能が得られ、マルチブランチ正則化戦略の有効性が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。