Skip to main content
QUICK REVIEW

[論文レビュー] Large-Scale Pre-training for Person Re-identification with Noisy Labels

Dengpan Fu, Dongdong Chen|arXiv (Cornell University)|Mar 30, 2022
Video Surveillance and Tracking Methods被引用数 5
ひとこと要約

本稿では、LUPersonデータセットの動画トラックレットから導出されたノイズのあるラベルを用いて、人物再識別(Re-ID)のための大規模な事前学習フレームワーク、PNLを提案する。教師あり学習、プロトタイプベースの対照的学習、ラベル誘導型対照的学習を統合的に最適化することで、PNLはノイズのあるラベルを効果的に是正し、強力な表現を学習する。複数のベンチマークで最先端の性能を達成し、CUHK03ではImageNet事前学習より5.7% mAP向上を達成し、少数ショット設定でも顕著な向上を示した。

ABSTRACT

This paper aims to address the problem of pre-training for person re-identification (Re-ID) with noisy labels. To setup the pre-training task, we apply a simple online multi-object tracking system on raw videos of an existing unlabeled Re-ID dataset "LUPerson" nd build the Noisy Labeled variant called "LUPerson-NL". Since theses ID labels automatically derived from tracklets inevitably contain noises, we develop a large-scale Pre-training framework utilizing Noisy Labels (PNL), which consists of three learning modules: supervised Re-ID learning, prototype-based contrastive learning, and label-guided contrastive learning. In principle, joint learning of these three modules not only clusters similar examples to one prototype, but also rectifies noisy labels based on the prototype assignment. We demonstrate that learning directly from raw videos is a promising alternative for pre-training, which utilizes spatial and temporal correlations as weak supervision. This simple pre-training task provides a scalable way to learn SOTA Re-ID representations from scratch on "LUPerson-NL" without bells and whistles. For example, by applying on the same supervised Re-ID method MGN, our pre-trained model improves the mAP over the unsupervised pre-training counterpart by 5.7%, 2.2%, 2.3% on CUHK03, DukeMTMC, and MSMT17 respectively. Under the small-scale or few-shot setting, the performance gain is even more significant, suggesting a better transferability of the learned representation. Code is available at https://github.com/DengpanFu/LUPerson-NL

研究の動機と目的

  • 人物再識別(Re-ID)のための限られた大規模で高品質なラベル付きデータの課題に対処するため、スケーラブルな事前学習ソースとして生の動画データを活用すること。
  • 汎用的なImageNet事前学習と人物中心のRe-IDタスクとの間のドメインギャップを軽減するため、ウェブ規模の未ラベル付き動画から学習すること。
  • ノイズのあるラベル、プロトタイプ、是正済みラベルを統合的に学習することで、表現学習を向上させる統一された事前学習フレームワークを開発すること。
  • 空間的・時間的動画相関に基づく弱教師ありのスーパービジョンが、ImageNetや無教師事前学習よりも優れたRe-ID特徴を生み出せることを示すこと。

提案手法

  • 21,000のシーンから成る1,000万枚の画像を含む大規模なRe-IDデータセット「LUPerson-NL」を構築し、生の動画上のマルチオブジェクトトラッキングから擬似ラベルを抽出する。
  • 3モジュールの事前学習フレームワークを導入:教師あり分類損失、動的に更新される重心を持つプロトタイプベースの対照的学習、是正済みラベルを用いたラベル誘導型対照的学習。
  • クラスタリングの安定化とトレーニングステップにわたるラベル是正の向上を図るため、プロトタイプ重心に移動平均更新を適用する。
  • エンドツーエンド学習により、プロトタイプ割り当ての一貫性と是正済みラベルの信頼度を統合最適化するジョイント最適化方式を採用する。
  • 特徴類似度行列を用いてラベル是正を可視化・検証し、誤ってラベル付けされた同一人物のクラスタリングが改善されていることを示す。
  • 後処理を施さずに、標準的なベースライン(MGNやIDE)を用いて公平な比較が可能なように、下流のRe-IDタスクに事前学習モデルを適用する。

実験結果

リサーチクエスチョン

  • RQ1生の動画から自動的に導出されたノイズのあるラベルを用いた大規模事前学習が、人物再識別においてImageNet事前学習を上回るか?
  • RQ2教師あり学習、プロトタイプベースの対照的学習、ラベル誘導型対照的学習を統合的に学習することは、ノイズのあるラベルの是正と表現学習の向上にどの程度効果的か?
  • RQ3空間的・時間的相関を活用した動画トラックレットからの弱教師ありスーパービジョンは、無教師または教師あり事前学習に比べ、より優れた転移可能特徴を生み出すか?
  • RQ4提案されたPNLフレームワークは、少数データ環境(たとえば、少数ショットや小規模設定)においてどの程度性能を向上させるか?
  • RQ5ラベル是正と対照的学習を統合した統一フレームワークは、付加的な調整なしに最先端の結果を達成できるか?

主な発見

  • PNL事前学習モデルは、CUHK03でImageNet教師あり事前学習より5.7% mAP向上、DukeMTMCで2.2%、MSMT17で2.3%向上した。
  • 小規模および少数ショット設定下でも、PNL事前学習による性能向上が顕著に顕在しており、優れた転送性を示している。
  • ラベル是正メカニズムは、同一人物の誤ってラベル付けされたトラックレット(Noise-I)を効果的に統合し、誤って同じグループにまとめられた異なるアイデンティティ(Noise-II)を正しく分離していることが、可視化マトリクスで確認された。
  • アブレーションスタディにより、ラベル是正が性能向上に顕著に寄与することが確認され、MSMT17ではラベル是正を含めることで1.3% mAP向上を達成した。
  • 4つのベンチマーク(CUHK03、Market1501、DukeMTMC、MSMT17)において、PNLベースのモデルは後処理を施さずに最先端の結果を達成し、先行手法を明確な差で上回った。
  • MGNを用いた場合、MSMT17で68.0/86.0 mAP、Market1501で91.9/96.6 mAPを達成し、前回のSOTAを大きく上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。