Skip to main content
QUICK REVIEW

[論文レビュー] Camera-Driven Representation Learning for Unsupervised Domain Adaptive Person Re-identification

Geon Lee, Sanghoon Lee|arXiv (Cornell University)|Aug 23, 2023
Video Surveillance and Tracking MethodsComputer Science被引用数 3
ひとこと要約

本稿では、ラベル付きソースドメインからラベルなしターゲットドメインへ段階的にモデルを適応させるカメラ駆動型カリキュラム学習(CaCL)フレームワークを提案する。カメララベルを活用することで、擬似ラベルのバイアスを軽減するカメラ多様性(CD)損失を導入し、カメラ間の変動に対して高い耐性を示し、標準ベンチマークで最先端の性能を達成した。

ABSTRACT

We present a novel unsupervised domain adaption method for person re-identification (reID) that generalizes a model trained on a labeled source domain to an unlabeled target domain. We introduce a camera-driven curriculum learning (CaCL) framework that leverages camera labels of person images to transfer knowledge from source to target domains progressively. To this end, we divide target domain dataset into multiple subsets based on the camera labels, and initially train our model with a single subset (i.e., images captured by a single camera). We then gradually exploit more subsets for training, according to a curriculum sequence obtained with a camera-driven scheduling rule. The scheduler considers maximum mean discrepancies (MMD) between each subset and the source domain dataset, such that the subset closer to the source domain is exploited earlier within the curriculum. For each curriculum sequence, we generate pseudo labels of person images in a target domain to train a reID model in a supervised way. We have observed that the pseudo labels are highly biased toward cameras, suggesting that person images obtained from the same camera are likely to have the same pseudo labels, even for different IDs. To address the camera bias problem, we also introduce a camera-diversity (CD) loss encouraging person images of the same pseudo label, but captured across various cameras, to involve more for discriminative feature learning, providing person representations robust to inter-camera variations. Experimental results on standard benchmarks, including real-to-real and synthetic-to-real scenarios, demonstrate the effectiveness of our framework.

研究の動機と目的

  • ソースドメインとターゲットドメインの間でカメラの配置が異なることによるドメインシフトの課題に対処すること。
  • 無教師領域適応の過程で生成される擬似ラベルに内在するカメラバイアスを軽減すること。具体的には、同じカメラからの画像が誤って同じ擬似IDにグループ化されるのを防ぐこと。
  • カリキュラムスケジュールに従い、ターゲットドメインの1台のカメラから複数のカメラに段階的にモデルを適応させることで、判別性の高い特徴学習を向上させること。
  • 特徴学習中に異なるカメラ間でクラスタの多様性を促進することで、カメラ間の変動に対する耐性を高めること。
  • 実世界対実世界および合成対実世界のベンチマークにおいて、無教師領域適応型再識別で最先端の性能を達成すること。

提案手法

  • ターゲットドメインのデータセットをカメララベルに基づいてサブセットに分割し、段階的カリキュラム学習の基盤を構築する。
  • カメラ駆動型スケジューリングルールにより、各カメラサブセットとソースドメインとの間の最大平均差(MMD)を計算し、ソースドメインに最も近いサブセットを優先順位に設定する。
  • モデルを繰り返し学習させ、最初は1つのカメラサブセットから開始し、MMDに基づく順序に従って徐々に追加のサブセットを統合する。
  • 各カリキュラム段階で、現在のモデルからの特徴を用いてクラスタリングを行い、擬似ラベルを生成し、ターゲットドメイン上で教師あり学習を可能にする。
  • 各クラスタに寄与するカメラ数に基づいて損失項を再重み付けするカメラ多様性(CD)損失を導入し、クラスタ内多様性を促進する。
  • CD損失により、同じ擬似IDに属する特徴が異なるカメラ間でより判別可能になるよう促進され、カメラ固有のバイアスが低減される。

実験結果

リサーチクエスチョン

  • RQ1カメララベルに基づくカリキュラム学習戦略は、人物再識別における無教師領域適応を改善できるか?
  • RQ2ターゲットサブセットとソースドメインとの間のMMDに基づくカメラ駆動型スケジューリングは、適応性能にどのように影響するか?
  • RQ3カメラ多様性(CD)損失は、カメラ間特徴類似性に起因する擬似ラベルバイアスをどの程度軽減できるか?
  • RQ41台のカメラから複数のカメラサブセットに段階的に適応させることで、ドメイン全体の適応よりも優れた一般化性能が得られるか?
  • RQ5CD損失は、不確実性に基づく重み付け手法(例:UGID)と比較して、カメラバイアスをどの程度効果的に軽減できるか?

主な発見

  • ランダムなカリキュラムシーケンスと比較して、カメラ駆動型スケジューラーは顕著に性能を向上させ、カリキュラム設計がUDA再識別において極めて重要であることを示した。
  • CD損失は、すべてのベンチマークでmAPおよびランク-1精度を一貫して向上させ、カメラバイアス低減の有効性を確認した。
  • Market1501からMSMT17への設定では、88.9%のmAPおよび92.1%のランク-1を達成し、新たな最先端性能を樹立した。
  • MSMT17からMarket1501への設定では、75.4%のmAPおよび84.3%のランク-1を達成し、先行する最先端手法を上回った。
  • CD損失とUGID重み付けを組み合わせることで最良の性能が得られ、多様性と不確実性を考慮した重み付けの相乗効果が示された。
  • 定性的な結果から、本手法は、従来手法が頻繁に同じカメラ内でも異なるIDの画像を混同するのとは異なり、カメラバイアスなしに正しいIDを正しく検索できることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。