Skip to main content
QUICK REVIEW

[論文レビュー] Semi-Supervised Crowd Counting via Self-Training on Surrogate Tasks

Yan Liu, Lingqiao Liu|arXiv (Cornell University)|Jul 7, 2020
Video Surveillance and Tracking Methods参考文献 55被引用数 5
ひとこと要約

本論文は、密度マップ回帰から導出された代替二値セグメンテーションタスクを自己学習で訓練することで、汎用的特徴抽出器を学習する半教師付きのクラウドカウント手法を提案する。複数のしきい値ベースのセグメンテーションタスク間の相関関係を活用し、未ラベルデータから信頼性の高い偽ラベルを生成することで、顕著に少ないラベル付き密度マップで最先端の性能を達成し、ラベル付けコストを低減するとともに、モデルのロバスト性を向上させる。

ABSTRACT

Most existing crowd counting systems rely on the availability of the object location annotation which can be expensive to obtain. To reduce the annotation cost, one attractive solution is to leverage a large number of unlabeled images to build a crowd counting model in semi-supervised fashion. This paper tackles the semi-supervised crowd counting problem from the perspective of feature learning. Our key idea is to leverage the unlabeled images to train a generic feature extractor rather than the entire network of a crowd counter. The rationale of this design is that learning the feature extractor can be more reliable and robust towards the inevitable noisy supervision generated from the unlabeled data. Also, on top of a good feature extractor, it is possible to build a density map regressor with much fewer density map annotations. Specifically, we proposed a novel semi-supervised crowd counting method which is built upon two innovative components: (1) a set of inter-related binary segmentation tasks are derived from the original density map regression task as the surrogate prediction target; (2) the surrogate target predictors are learned from both labeled and unlabeled data by utilizing a proposed self-training scheme which fully exploits the underlying constraints of these binary segmentation tasks. Through experiments, we show that the proposed method is superior over the existing semisupervised crowd counting method and other representative baselines.

研究の動機と目的

  • 大規模な未ラベル付き画像を半教師付き学習の文脈で活用することで、クラウドカウントの高いラベル付けコストを低減すること。
  • ノイズの多い未ラベル付きデータに対して、完全なクラウドカウンターではなく汎用的特徴抽出器を訓練することで、モデルのロバスト性を向上させること。
  • 回帰ベースの半教師付き学習における信頼性の低い偽ラベルの課題に対処するため、代替二値セグメンテーションタスクを定式化すること。
  • 複数のしきい値ベースのセグメンテーションタスク間の構造的相関関係を活用し、自己学習に用いるためのより信頼性の高い偽ラベルを生成すること。
  • 事前学習された特徴抽出器が、最小限の真値密度マップラベルを用いて高精度な密度マップ回帰を可能にすることを実証すること。

提案手法

  • 本手法は、密度マップ回帰を、各ピクセルの密度が事前に定義されたしきい値を超えるかどうかを予測する一連の関連する二値セグメンテーションタスクに定式化する。
  • 各代替タスクに対して、ラベル付きデータ(真値偽ラベルを伴う)と未ラベル付きデータ(自己学習による生成された偽ラベルを伴う)を用いてセグメンテーション予測器を訓練する。
  • 予測値がより高いしきい値に対して予測された場合、それより低いしきい値に対しても予測されるべきであるという論理的整合性を保証する、新しい自己学習戦略を採用する。
  • 信頼度しきい値とタスク間制約を用いて、未ラベル付き画像に対して真値がない状態でも、偽ラベルをフィルタリング・精錬し、信頼性を向上させる。
  • 学習された特徴抽出器は、その後、わずかな数のラベル付き密度マップを用いて微調整され、最終的なクラウドカウントモデルが得られる。
  • 本手法はShanghaiTech Part_AおよびUCF-QNRFデータセットで評価され、異なるアーキテクチャにわたって優れた汎化性能とロバスト性を示している。

実験結果

リサーチクエスチョン

  • RQ1密度マップ回帰から導出された代替二値セグメンテーションタスクは、半教師付きクラウドカウントの性能を向上させることができるか?
  • RQ2複数のしきい値ベースのセグメンテーションタスク間の関連性制約を用いた自己学習は、未ラベル付きデータに対する信頼性の高い偽ラベルの生成にどの程度効果的か?
  • RQ3代替タスク上で特徴抽出器を事前学習することで、ラベル付き密度マップの数を減らしても、より良い下流の密度マップ回帰が達成できるか?
  • RQ4予測信頼度しきい値 $t_p$ のようなハイパーパrameterの変更に対して、本手法はどの程度感度を示すか?
  • RQ5提案手法は、異なるバックボーンアーキテクチャやデータセットに一般化可能か?

主な発見

  • 提案手法IRAISTは、ShanghaiTech Part_AでMAE 86.9、UCF-QNRFでMAE 135.6を達成し、既存の半教師付き手法および強力なベースラインを上回る性能を示した。
  • 偽ラベル生成時に相互関係制約を除去すると、性能が著しく低下し、信頼性の高いラベルを向上させる上でその制約が果たす重要な役割を確認した。
  • 予測信頼度しきい値 $t_p$ の変更に対して本手法はロバストであり、異なる値でも性能にほとんど変動がなく、安定した挙動を示した。
  • CSRNetの代わりにSPNを特徴抽出器として使用することで、さらに性能が向上したため、多様なネットワークアーキテクチャと高い互換性があることが示された。
  • 3つの代替タスク(しきい値0.5N、0.7N、0.9N)が最良の性能を示し、密度のより細かい分割は結果を向上させないことが示唆された。
  • アブレーションスタディにより、代替タスク上で特徴抽出器を学習する方が、元の回帰タスクでエンドツーエンドの半教師付き学習よりも効果的であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。