Skip to main content
QUICK REVIEW

[論文レビュー] Unsupervised Pre-training for Person Re-identification

Dengpan Fu, Dongdong Chen|arXiv (Cornell University)|Dec 7, 2020
Video Surveillance and Tracking Methods参考文献 41被引用数 5
ひとこと要約

本論文は、400万枚の画像と20万のIDを有する自己教師あり事前学習データセットLUPersonを紹介し、この大規模かつ多様なデータセット上で自己教師あり事前学習を実施することで、人物再識別(Re-ID)特徴の一般化性能が顕著に向上することを示した。慎重に設計されたデータ拡張および対照的損失の構成—有害な色のジャイタを回避し、RandomErasingを導入することで—、複数のRe-IDベンチマークで最先端の性能を達成し、Market1501では最大3.5% mAP、CUHK03では2.9% mAPの向上を達成した。特に、装飾的な調整なしに実現された。

ABSTRACT

In this paper, we present a large scale unlabeled person re-identification (Re-ID) dataset "LUPerson" and make the first attempt of performing unsupervised pre-training for improving the generalization ability of the learned person Re-ID feature representation. This is to address the problem that all existing person Re-ID datasets are all of limited scale due to the costly effort required for data annotation. Previous research tries to leverage models pre-trained on ImageNet to mitigate the shortage of person Re-ID data but suffers from the large domain gap between ImageNet and person Re-ID data. LUPerson is an unlabeled dataset of 4M images of over 200K identities, which is 30X larger than the largest existing Re-ID dataset. It also covers a much diverse range of capturing environments (eg, camera settings, scenes, etc.). Based on this dataset, we systematically study the key factors for learning Re-ID features from two perspectives: data augmentation and contrastive loss. Unsupervised pre-training performed on this large-scale dataset effectively leads to a generic Re-ID feature that can benefit all existing person Re-ID methods. Using our pre-trained model in some basic frameworks, our methods achieve state-of-the-art results without bells and whistles on four widely used Re-ID datasets: CUHK03, Market1501, DukeMTMC, and MSMT17. Our results also show that the performance improvement is more significant on small-scale target datasets or under few-shot setting.

研究の動機と目的

  • 既存の人物Re-IDデータセットの規模と多様性の不足が、効果的なモデル学習を妨げているという問題に対処すること。
  • 大規模かつラベルなしのRe-IDデータセット上で自己教師あり事前学習を実施することで、特徴の一般化性能が向上し、高価なアノテーションへの依存が軽減されるかを調査すること。
  • データ拡張や対照的損失の設定といった、自己教師あり学習がRe-IDに有効である要因を同定すること。
  • 自己教師あり事前学習が、教師ありおよび非教師ありの両方のRe-ID手法に一般化可能であることを示し、小規模および少データ設定でも性能向上を達成すること。

提案手法

  • 46,000本のYouTube動画から構成され、400万枚の画像を含む大規模かつラベルなしのRe-IDデータセットLUPersonを構築した。カメラタイプ、シーン、解像度の多様性をカバーしている。
  • MoCo v2をバックボーンフレームワークとして採用したが、Re-IDに特化したニーズに適合させるために、重要なコンponentを変更した対照的自己教師あり学習を適用した。
  • 色のジャイタがRe-IDに有害であることが判明し、データ拡張から除外した。これにより、色が重要な識別的特徴として保持された。
  • 対照的学習中の自明な解への収束を防ぐために、RandomErasingを強力なデータ拡張として導入した。
  • 特徴の識別性とハードネガティブマイニングのバランスを取るために、対照的損失における温度パラメータを最適化した。
  • 強力なベースライン(例:MGN、BDB)および非教師あり手法(例:SpCL)を用いて、事後処理や追加微調整なしに、複数のRe-IDベンチマークで事前学習モデルを評価した。

実験結果

リサーチクエスチョン

  • RQ1LUPersonのような大規模かつラベルなしの多様なRe-IDデータセット上で、自己教師あり事前学習を実施することで、人物Re-ID特徴の一般化性能が顕著に向上するか?
  • RQ2標準的な対照的学習コンponents(例:色のジャイタ、RandomErasing)がRe-ID性能に与える影響は何か?最適な結果を得るためにはどのような変更が必要か?
  • RQ3自己教師あり事前学習は、小規模または少データ設定のRe-IDデータセットに対して、フルスケールのものよりもより大きな性能向上をもたらすか?
  • RQ4事前学習された表現は、教師ありおよび非教師ありの両方のRe-IDフレームワークに一般化可能であり、最先端の性能を向上させられるか?
  • RQ5対照的損失における温度パラメータは、Re-IDにおける特徴の識別性とハードネガティブマイニングのバランスをどのように調整するか?

主な発見

  • LUPerson上で提案された自己教師あり事前学習は、MGNベースラインを用いることでMarket1501で3.5% mAP、DukeMTMCで2.7% mAPの向上を達成し、すべての先行最先端手法を上回った。
  • CUHK03では、BDBベースラインに対して2.9% mAPの向上を達成し、以前の最先端手法であるSONAを上回った。
  • 小規模および少データ設定でも、性能向上が顕著に現れ、データ不足下でも本手法の有効性が示された。
  • 非教師あり学習(USL)設定において、事前学習モデルは最先端の非教師あり手法SpCLを、Market1501で3.8 mAP、DukeMTMCで2.2 mAP向上させた。
  • より大きなバックボーンに対しても一般化がうまくいった。ResNet101ベースのモデルでは、MSMT17で68.8% mAP、Market1501で92.0% mAPを達成し、スケーラビリティが確認された。
  • 本研究では、色のジャイタがRe-IDに悪影響を及けることが判明し、RandomErasingが収束を防ぐために不可欠であることが明らかになった。これにより、対照的学習におけるタスク特化型設計の重要性が強調された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。