Skip to main content
QUICK REVIEW

[論文レビュー] Domain-adaptive Crowd Counting via High-quality Image Translation and Density Reconstruction

Junyu Gao, Tao Han|arXiv (Cornell University)|Dec 8, 2019
Video Surveillance and Tracking Methods参考文献 63被引用数 7
ひとこと要約

本稿では、合成群衆画像を現実的ないくらつかに変換するためのドメイン適応型群衆カウント(DACC)を提案する。この手法は、ドメイン間特徴の分離とコンテンツに配慮した損失関数を用いて、画像変換を実施し、その後ガウス事前分布を用いた疑似密度マップ再構築により最終的なカウンターを再訓練する。DACCは、6つの実世界データセットにおいて最先端の性能を達成し、従来のドメイン適応手法と比較してMAEおよびMSEが顕著に低減された。

ABSTRACT

Recently, crowd counting using supervised learning achieves a remarkable improvement. Nevertheless, most counters rely on a large amount of manually labeled data. With the release of synthetic crowd data, a potential alternative is transferring knowledge from them to real data without any manual label. However, there is no method to effectively suppress domain gaps and output elaborate density maps during the transferring. To remedy the above problems, this paper proposes a Domain-Adaptive Crowd Counting (DACC) framework, which consists of a high-quality image translation and density map reconstruction. To be specific, the former focuses on translating synthetic data to realistic images, which prompts the translation quality by segregating domain-shared/independent features and designing content-aware consistency loss. The latter aims at generating pseudo labels on real scenes to improve the prediction quality. Next, we retrain a final counter using these pseudo labels. Adaptation experiments on six real-world datasets demonstrate that the proposed method outperforms the state-of-the-art methods.

研究の動機と目的

  • 合成群衆シーンと実世界の群衆シーンの間のドメインギャップを解消し、群衆カウントにおける効果的な転移学習を促進すること。
  • ドメイン共有特徴とドメイン固有特徴を分離することで、密な群衆に不可欠なテクスチャや局所パターンを保持する画像変換品質を向上させること。
  • ガウスカーネル事前分布を用いて、実シーン用の正確な疑似密度マップを生成し、最終的な群衆カウンターの有効な再訓練を可能にすること。
  • 実データに対する手動アノテーションを一切必要とせず、ドメイン適応型群衆カウントで最先端の性能を達成すること。

提案手法

  • ドメイン共有特徴(例:人物の構造、群衆のパターン)を最初に抽出し、その後ドメイン固有特徴(例:背景、センサー効果)と組み合わせて、ターゲットドメインに類似した画像を再構築する2段階のチェーンアーキテクチャである「ドメイン間特徴分離(IFS)」を提案する。
  • 局所構造とテクスチャの保持を促進するため、マルチスケールの敵対的変換損失とコンテンツに配慮した一貫性損失を導入し、従来のCycleGAN損失と比較して歪みを低減する。
  • 翻訳された合成画像で事前学習した粗いカウンターを用いて、実シーンにおける初期密度マップを生成する。
  • ガウス事前分布に基づく再構築(GPR)を適用し、粗い予測と標準ガウスカーネルを一致させることで、高品質な疑似密度マップを生成する。これは、頭部の既知の空間的分布を活用する。
  • 実画像と再構築された疑似密度マップを用いて最終的な群衆カウンターを再訓練し、実データにおける予測精度を顕著に向上させる。
  • 密度マップ品質の向上と誤差の低減を図る再訓練スキームを採用し、特に複雑または混雑したシーンにおいて顕著な効果を発揮する。

実験結果

リサーチクエスチョン

  • RQ1ドメイン共有特徴とドメイン固有特徴を分離することで、群衆カウントにおける合成画像から実画像への変換品質が向上するか?
  • RQ2コンテンツに配慮した損失およびマルチスケールの敵対的損失は、変換された群衆画像におけるテクスチャおよび構造的歪みを低減できるか?
  • RQ3ガウス事前分布に基づく疑似密度マップ再構築は、実世界データにおける群衆カウンターの性能を向上させられるか?
  • RQ4提案されたDACCフレームワークは、合成データから実データへのゼロショット群衆カウントにおいて、既存のドメイン適応手法を上回る性能を発揮するか?

主な発見

  • DACCは6つの実世界群衆カウントデータセットにおいて最先端の性能を達成し、既存のドメイン適応手法を顕著に上回った。
  • Shanghai Tech Part Aデータセットでは、適応なしの場合のMAEが206.7から112.4に、MSEが297.1から176.9に低下し、教師あり学習の性能(MAE 69.6、MSE 125.9)に近づいた。
  • 提案されたIFSモジュールは、交換実験における一貫した特徴可視化により、ドメイン共有特徴を効果的に抽出できることを示し、ロバスト性と一般化性能が確認された。
  • ガウス事前分布に基づく疑似ラベル再構築は、視覚的比較により、ベースライン手法よりも真値に近い密度マップ品質を実現した。
  • 定量的結果から、DACCは背景オブジェクトに対する誤予測を低減しており、特に非群衆領域の過剰推定を回避していることが確認された。
  • 除去実験により、IFSおよびGPRの両コンponentsが不可欠であることが確認され、いずれかを除去すると性能が著しく低下した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。