Skip to main content
QUICK REVIEW

[論文レビュー] Identity Preserving Generative Adversarial Network for Cross-Domain Person Re-identification

Jialun Liu|arXiv (Cornell University)|Nov 28, 2018
Video Surveillance and Tracking Methods参考文献 36被引用数 4
ひとこと要約

本稿では、ラベル付きのソースドメインの人物画像を、アイデンティティの意味を保持したままターゲットカメラドメインに変換する、新しい非教師ありドメイン適応手法であるアイデンティティ保持生成対抗ネットワーク(IPGAN)を提案する。アイデンティティに正確なスタイル変換画像を生成することで、より汎用性の高いre-IDモデル(IBN-reID)の訓練が可能となり、Market-1501とDukeMTMC-reIDでそれぞれ57.2%および47.0%のランク-1精度を達成し、最先端の性能を発揮した。

ABSTRACT

Person re-identification is to retrieval pedestrian images from no-overlap camera views detected by pedestrian detectors. Most existing person re-identification (re-ID) models often fail to generalize well from the source domain where the models are trained to a new target domain without labels, because of the bias between the source and target domain. This issue significantly limits the scalability and usability of the models in the real world. Providing a labeled source training set and an unlabeled target training set, the aim of this paper is to improve the generalization ability of re-ID models to the target domain. To this end, we propose an image generative network named identity preserving generative adversarial network (IPGAN). The proposed method has two excellent properties: 1) only a single model is employed to translate the labeled images from the source domain to the target camera domains in an unsupervised manner; 2) The identity information of images from the source domain is preserved before and after translation. Furthermore, we propose IBN-reID model for the person re-identification task. It has better generalization ability than baseline models, especially in the cases without any domain adaptation. The IBN-reID model is trained on the translated images by supervised methods. Experimental results on Market-1501 and DukeMTMC-reID show that the images generated by IPGAN are more suitable for cross-domain person re-identification. Very competitive re-ID accuracy is achieved by our method.

研究の動機と目的

  • 人物再識別におけるドメインシフト問題に対処する。これは、あるドメインで訓練されたモデルが、スタイルや分布の違いにより未観測のターゲットドメインでは失敗するためである。
  • 既存のGANベースの手法が、ターゲットドメイン内の個々のカメラ間のサブドメインレベルのバイアスを無視するという制限を克服する。
  • ソースドメインからターゲットカメラドメインへの画像変換中にアイデンティティの意味を保持することで、合成学習データにおけるラベルの一貫性を維持する。
  • 教師なし画像変換と、新しい正規化に基づくre-IDアーキテクチャを活用することで、ターゲットドメインのラベル付きデータを必要とせずにモデルの汎用性を向上させる。
  • 単一のジェネレータとアイデンティティ不変の変換を用いて、クロスドメイン設定において競争力のあるre-ID精度を達成する。

提案手法

  • ソースドメインから複数のターゲットカメラドメインへの画像変換を、単一のジェネレータとドメイン識別器を用いて行うGANベースの画像変換フレームワークであるIPGANを提案する。
  • 本稿では、実画像と変換画像のアイデンティティ埋め込みが一貫していることを保証することで、アイデンティティ不変性を強制する新しい意味的識別器を導入する。
  • 生成器を、敵対的損失とアイデンティティ再構成損失の両方を最小化するように訓練することで、変換画像が元の画像と同じアイデンティティを保持していることを保証する。
  • 元のラベルを保持しながらターゲットカメラのスタイルを採用した生成画像を、教師ありre-IDモデルの合成学習データセットとして使用する。
  • インスタンス正規化とバッチ正規化を残差ブロックに統合することで、外観不変性と特徴の識別能を向上させるIBN-reIDモデルを設計する。
  • 教師あり学習を用いて、変換されたデータ上でIBN-reIDモデルを訓練することで、未観測のターゲットドメインへの汎用性を向上させる。

実験結果

リサーチクエスチョン

  • RQ11つの生成モデルが、アイデンティティ情報を保持したまま、複数の異なるターゲットカメラドメインに画像を効果的に変換できるか?
  • RQ2画像変換中にアイデンティティ不変性を強制することで、未観測ドメインにおける人物再識別モデルの性能が顕著に向上するか?
  • RQ3インスタンス正規化とバッチ正規化を組み合わせたIBN-reIDモデルのアーキテクチャが、クロスドメインre-IDにおける汎用性をどの程度向上させるか?
  • RQ4提案されたIPGANベースのドメイン適応手法は、最先端の非教師ありre-ID手法と比較して、精度と頑健性の面で優れているか?
  • RQ5アイデンティティ保持型画像変換は、標準のGANやサイクル整合性GANと比較して、ソースドメインとターゲットカメラドメイン間のドメインシフトをより効果的に低減できるか?

主な発見

  • IPGANが生成した画像は、DukeMTMC-reIDとMarket-1501のトレーニングセットでそれぞれ97.0%および99.0%の分類精度を示し、強いアイデンティティ保持性を示している。
  • IPGANを用いて直接ソースドメインから転移したIBN-reIDモデルは、DukeMTMC-reIDでランク-1精度32.4%、mAP17.3を達成し、ベースラインより+2.2%と+1.2%の向上を示した。
  • IPGANを用いたデータ合成により、IBN-reIDモデルはMarket-1501で57.2%のランク-1精度と28.0%のmAPを達成し、既存の最良手法を上回った。
  • DukeMTMC-reIDでは、47.0%のランク-1精度と27.0%のmAPを達成し、CamStyleを+1.9 mAPポイント上回った。
  • IPGANとIBN-reIDの組み合わせは、最も優れた全体的な性能を示した。IPGAN生成データ上でIBN-reIDを用いた場合、わずかな向上しか得られなかったため、IPGANがすでにドメインシフトを効果的に緩和していることが示唆された。
  • StarGANと比較して、IPGANは生成画像におけるアイデンティティ分類精度が顕著に高く、アイデンティティの意味をより効果的に保持していることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。