Skip to main content
QUICK REVIEW

[論文レビュー] Leveraging Virtual and Real Person for Unsupervised Person Re-identification

Fengxiang Yang, Zhun Zhong|arXiv (Cornell University)|Nov 5, 2018
Video Surveillance and Tracking Methods参考文献 12被引用数 4
ひとこと要約

本稿では、ラベルなしで深層re-IDモデルを訓練するために、合成(仮想)人物画像と実際の人物画像を活用する新しい教師なし人物再識別フレームワークを提案する。GANを用いたポーズおよびスタイル変換により仮想人物の疑似ラベルを生成し、協調フィルタリングを用いて反復的に信頼性の高い正例ペアを実データからマイニングすることで、Market-1501およびDukeMTMC-reIDで最先端の性能を達成した。

ABSTRACT

Person re-identification (re-ID) is a challenging problem especially when no labels are available for training. Although recent deep re-ID methods have achieved great improvement, it is still difficult to optimize deep re-ID model without annotations in training data. To address this problem, this study introduces a novel approach for unsupervised person re-ID by leveraging virtual and real data. Our approach includes two components: virtual person generation and training of deep re-ID model. For virtual person generation, we learn a person generation model and a camera style transfer model using unlabeled real data to generate virtual persons with different poses and camera styles. The virtual data is formed as labeled training data, enabling subsequently training deep re-ID model in supervision. For training of deep re-ID model, we divide it into three steps: 1) pre-training a coarse re-ID model by using virtual data; 2) collaborative filtering based positive pair mining from the real data; and 3) fine-tuning of the coarse re-ID model by leveraging the mined positive pairs and virtual data. The final re-ID model is achieved by iterating between step 2 and step 3 until convergence. Experimental results on two large-scale datasets, Market-1501 and DukeMTMC-reID, demonstrate the effectiveness of our approach and shows that the state of the art is achieved in unsupervised person re-ID.

研究の動機と目的

  • ラベルなしのトレーニングデータで深層人物再識別モデルを訓練する課題に対処すること。
  • 手作業で特徴を設計する手法が失敗する大規模データセットにおける教師なしre-IDの性能を向上させること。
  • ラベルなしの実データと合成された仮想データのみを用いて、教師付きスタイルの深層re-IDモデルの訓練を可能にすること。
  • ラベルなしの実データから信頼性の高い正例画像ペアをマイニングする強固な手法を開発すること。
  • ベンチマークデータセットにおける教師なし人物再識別で最先端の性能を達成すること。

提案手法

  • ポーズの変動を実現するためDPG-GAN、カメラのスタイル変換のためStar-GANを用いて仮想人物画像を生成し、疑似ラベル付きのトレーニングデータを作成する。
  • 識別子分類損失(L_cls)を用いて、生成された仮想データ上で粗いre-IDモデルを事前学習する。
  • 事前学習済みモデルを用いて特徴量を抽出し、実データにおけるk-相互最近傍(k-RNN)を計算して、初期の正例ペア候補を特定する。
  • 協調フィルタリングに基づくアプローチを用いて、誤検出の正例ペアを除外し、実データから信頼性の高い正例ペアを選択する。
  • 仮想データにおけるL_clsとマイニングされた実データの正例ペアにおける三重損失を組み合わせたマルチタスク損失を用いてre-IDモデルをファインチューニングする。
  • 収束するまで、正例ペアマイニングとモデルファインチューニングを繰り返し実行することで、モデルの頑健性と精度を向上させる。

実験結果

リサーチクエスチョン

  • RQ1ラベルなしの実際のアノテーションが存在する状況で、疑似ラベルが付与された合成仮想人物画像が、深層re-IDモデルの事前学習に効果的に機能するか?
  • RQ2協調フィルタリングは、教師なしre-IDにおけるラベルなし実データからの正例ペアマイニングの品質を向上させることができるか?
  • RQ3仮想データと洗練された実データペアを組み合わせることで、大規模re-IDベンチマークにおける一般化性能と性能が向上するか?
  • RQ4仮想データのスケール、バッチサイズ、損失重み付けといったハイパーパrameterへの感受性はどの程度か?
  • RQ5提案されたフレームワークは、いかなるラベルなしデータも使用せずに、教師なし人物再識別で最先端の性能を達成できるか?

主な発見

  • 提案手法は、教師なし設定下でMarket-1501およびDukeMTMC-reIDで最先端の性能を達成し、既存手法を上回った。
  • 協調フィルタリングを用いたマイニングは、Market-1501とDukeMTMC-reIDでそれぞれランク1精度をランダム選択に比べ6.6%および2.9%向上させた。
  • マイニングされた正例ペアの精度は、ランダム選択時の29.0%および14.5%から、協調フィルタリングを用いた場合の67.5%および40.5%に上昇し、ペアの品質が向上していることが確認された。
  • 仮想データセットのサイズがMarket-1501では36体、DukeMTMC-reIDでは48体の人物に達すると、モデル性能は飽和した。
  • マルチタスク学習における最適な損失重み付け(λ)は約1であり、分類損失と三重損失が性能に同等に寄与していた。
  • kおよびバッチサイズ(N_r)の変動に対しても、本手法は頑健であり、テストした設定すべてで性能の変動が最小限に抑えられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。