[論文レビュー] Towards Unsupervised Crowd Counting via Regression-Detection Bi-knowledge Transfer
本論文は、ラベル付きソースドメインの回帰ベースおよび検出ベースモデルから、シーンに依存しないトランスフォーマーを用いた相互知識蒸留により、ラベルなしのターゲットドメインへ二重知識を転送する非教師あり集団数え上げ手法を提案する。この手法は、融合された偽ラベルを用いて反復的に両モデルを共同訓練する。ShanghaiTech、UCF_CC_50、UCF_QNRFベンチマークにおいて、従来手法と比較してMAEおよびMSEの大幅な向上を達成し、最先端の性能を実現する。
Unsupervised crowd counting is a challenging yet not largely explored task. In this paper, we explore it in a transfer learning setting where we learn to detect and count persons in an unlabeled target set by transferring bi-knowledge learnt from regression- and detection-based models in a labeled source set. The dual source knowledge of the two models is heterogeneous and complementary as they capture different modalities of the crowd distribution. We formulate the mutual transformations between the outputs of regression- and detection-based models as two scene-agnostic transformers which enable knowledge distillation between the two models. Given the regression- and detection-based models and their mutual transformers learnt in the source, we introduce an iterative self-supervised learning scheme with regression-detection bi-knowledge transfer in the target. Extensive experiments on standard crowd counting benchmarks, ShanghaiTech, UCF\_CC\_50, and UCF\_QNRF demonstrate a substantial improvement of our method over other state-of-the-arts in the transfer learning setting.
研究の動機と目的
- ターゲットドメインにラベル付きデータが利用できないクロスドメイン設定における非教師あり集団数え上げの課題に対処すること。
- 回帰ベースモデル(高密度集団に適している)と検出ベースモデル(低密度シーンに適している)の相補的特長を、知識蒸留を用いて統合すること。
- モデル出力間の相互変換を学習することで、ラベル付きソースドメインからラベルなしターゲットドメインへの有効な転移学習を可能にすること。
- 融合された偽ラベルを用いて、ターゲットドメインにおける回帰および検出性能を向上させる自己教師的反復的共同訓練フレームワークの構築
提案手法
- 回帰モデルと検出モデルの出力を相互に変換できる2つのシーンに依存しないトランスフォーマー(Reg-to-Det および Det-to-Reg)を学習し、相互知識蒸留を可能にする。
- DMS-SSIMを組み合わせた新規のフォーカルMSE損失を用いてReg-to-Detトランスフォーマーを訓練し、ターゲットドメインにおける局所化精度を向上させる。
- 反復的自己教師学習を適用:各反復で、両モデルが融合された偽ラベル(密度マップおよびバウンディングボックス)を生成し、それらを用いて両モデルを再び精緻化する。
- 検出結果をガウス畳み込みにより密度マップに変換し、逆にデコンボリューションに類似した操作を用いて密度マップを再構成することで、回帰と検出の出力を統合する。
- 二重ブランチネットワークアーキテクチャを採用。回帰ヘッドと検出ヘッドは、他方のモダリティから生成された偽ラベルを用いて共同最適化される。
- Reg-to-Detトランスフォーマーは、ソースドメインで小さなデータサブセットを用いて訓練され、そのシーンに依存しない性質と一般化能力が示されている。
実験結果
リサーチクエスチョン
- RQ1回帰ベースおよび検出ベースの集団数え上げモデルから得られる相補的知識は、非教師ありドメイン適応設定において効果的に転送可能か?
- RQ2回帰モデルと検出モデルの異種出力間で、どのように相互知識蒸留を形式化できるか?
- RQ3シーンに依存しないトランスフォーマーは、ドメインをまたいで効果的なクロスモデル知識転送を可能にするか?
- RQ4融合された偽ラベルを用いた反復的自己教師的共同訓練は、ラベルなしターゲットデータにおける性能向上に寄与するか?
主な発見
- 提案手法は、非教師あり転移学習設定において、ShanghaiTech、UCF_CC_50、UCF_QNRFベンチマークで新たな最先端性能を達成した。
- ShanghaiTechデータセット(SHB → SHA)において、MAEは112.24、MSEは218.18にまで低下し、従来の最先端手法を上回った。
- ソースデータの30%のみで訓練されたReg-to-Detトランスフォーマーは、A→Qで0.406 mAP、A→Bで0.610 mAPを達成し、優れた一般化能力とシーンに依存しない性質を示した。
- アブレーションスタディの結果、融合処理と自己教師的反復を含む完全な手法が最良の性能を示し、MAEは112.24、mAPは0.661を達成。融合なしやランダムサンプリングを用いたバリアントよりも優れた性能を示した。
- 反復的共同訓練プロセスは4反復目で安定化し、それ以降はわずかな向上しか得られず、収束性とロバスト性を示した。
- Reg-to-DetトランスフォーマーにおけるフォーカルMSEとDMS-SSIM損失の使用は、A→Qで0.448 mAPを達成し、標準MSE損失(0.347)やフォーカルCE損失(0.399)を顕著に上回った。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。