Skip to main content
QUICK REVIEW

[論文レビュー] Similarity-preserving Image-image Domain Adaptation for Person Re-identification

Weijian Deng, Liang Zheng|arXiv (Cornell University)|Nov 26, 2018
Video Surveillance and Tracking Methods参考文献 69被引用数 22
ひとこと要約

本稿では、生成対抗ネットワーク(SPGAN)とそのエンドツーエンド拡張版(eSPGAN)を用いた類似性保持型画像間ドメイン適応フレームワークを、人物再識別(person re-identification)に対して提案する。スタイル変換中に同一人物の類似性を維持し、画像変換と特徴学習を統合的に最適化することで、Market-1501およびDukeMTMC-reIDで最先端の性能を達成した。eSPGANは、LMPを用いてMarket-1501の単一クエリ設定下で63.6%のランク-1精度を達成した。

ABSTRACT

This article studies the domain adaptation problem in person re-identification (re-ID) under a "learning via translation" framework, consisting of two components, 1) translating the labeled images from the source to the target domain in an unsupervised manner, 2) learning a re-ID model using the translated images. The objective is to preserve the underlying human identity information after image translation, so that translated images with labels are effective for feature learning on the target domain. To this end, we propose a similarity preserving generative adversarial network (SPGAN) and its end-to-end trainable version, eSPGAN. Both aiming at similarity preserving, SPGAN enforces this property by heuristic constraints, while eSPGAN does so by optimally facilitating the re-ID model learning. More specifically, SPGAN separately undertakes the two components in the "learning via translation" framework. It first preserves two types of unsupervised similarity, namely, self-similarity of an image before and after translation, and domain-dissimilarity of a translated source image and a target image. It then learns a re-ID model using existing networks. In comparison, eSPGAN seamlessly integrates image translation and re-ID model learning. During the end-to-end training of eSPGAN, re-ID learning guides image translation to preserve the underlying identity information of an image. Meanwhile, image translation improves re-ID learning by providing identity-preserving training samples of the target domain style. In the experiment, we show that identities of the fake images generated by SPGAN and eSPGAN are well preserved. Based on this, we report the new state-of-the-art domain adaptation results on two large-scale person re-ID datasets.

研究の動機と目的

  • データセットバイアスおよびドメインシフトのため、人物再識別モデルのドメイン間一般化性能が低いという問題に対処する。
  • 共有クラス集合を仮定する従来の教師なしドメイン適応手法の制限を克服する。これは、人物再識別ではその仮定が成り立たないためである。
  • ソースドメインからターゲットドメインへの画像変換中に、識別的な本人特徴を保持する。これにより、スタイル変更に対しても本人の一貫性が保たれる。
  • 画像変換と特徴学習をエンドツーエンドフレームワークに統合し、相互最適化を可能にすることで、適応性能を向上させる。
  • ターゲットドメインのアノテーションに依存せずに、大規模な人物再識別ベンチマークで最先端のドメイン適応性能を達成する。

提案手法

  • 画像変換にCycleGANを用い、同一人物の類似性とドメインの相違性を制御する対照損失を用いることで、類似性保持型の2部構成フレームワーク(SPGAN)を提案する。
  • SPGANでは、シアンセイネットワークが、変換されたソース画像とその元の対応画像を引き寄せる一方で、ターゲットドメインの他の画像から遠ざけることで、教師なしの方法で本人の手がかりを保持する。
  • eSPGANを導入し、画像変換と再識別特徴学習を交互に最適化することで、エンドツーエンドで統合的に最適化する。これにより、各モジュールが互いにガイドし合うことが可能になる。
  • SPGANでは対照損失を用い、本人の自己類似性を維持するとともにドメインの相違性を導入することで、変換画像が本人情報を保持しつつターゲットドメインのスタイルに適合することを保証する。
  • LMP(局所的最大出現プーリング)を後処理の強化として組み込み、特にマルチクエリ設定下での性能向上を図る。
  • 画像変換には敵対的損失、本人保持には対照損失を用い、eSPGANではエンドツーエンドの誤差逆伝播により学習を実行する。

実験結果

リサーチクエスチョン

  • RQ1ソースドメインからターゲットドメインへの画像変換が、人物再識別における歩行者の本質的本人情報(identity information)を保持できるか。
  • RQ2教師なし画像変換を、新しいドメインの視覚的スタイルに適応させつつ、識別的な本人特徴を維持するように制約できるか。
  • RQ3エンドツーエンドで画像変換と特徴学習を同時に最適化することで、人物再識別におけるドメイン適応性能が向上するか。
  • RQ4類似性保持型GANフレームワークは、大規模な人物再識別データセットにおいて、既存の最先端の教師なしドメイン適応手法を上回ることができるか。
  • RQ5画像変換パイプラインに本人保持制約を統合することで、下流の再識別精度にどのような影響を与えるか。

主な発見

  • eSPGANは、Market-1501の単一クエリ設定下で63.6%のランク-1精度を達成し、2番目に良い手法HHLを1.4%上回り、新たな最先端性能を記録した。
  • DukeMTMC-reIDでは、LMP(P=8)を用いて52.6%のランク-1精度を達成し、SOTAを更新。HHLを1.0%上回った。
  • SPGANは、Market-1501の単一クエリ設定下で59.5%のランク-1精度を達成し、TJ-AIDLを1.3%上回り、強力な競争力を示した。
  • LMP(P=8)の統合により、eSPGANの性能がMarket-1501で63.6%に向上し、後処理がドメイン適応の効果をさらに高めることを示した。
  • eSPGANのエンドツーエンド学習は、SPGANよりも優れた性能を示し、画像変換と特徴学習の統合的最適化の利点を裏付けた。
  • SPGANおよびeSPGANは、ボキャブラリー特徴(例:BoW, LOMO)や教師なし手法(PUL, UMDL)を著しく上回り、ドメイン適応における有効性を検証した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。