Skip to main content
QUICK REVIEW

[論文レビュー] Apparel-invariant Feature Learning for Apparel-changed Person Re-identification

Zhengxu Yu, Yilun Zhao|arXiv (Cornell University)|Aug 14, 2020
Video Surveillance and Tracking Methods参考文献 48被引用数 5
ひとこと要約

本論文は、衣装変更下でも人物再識別性能を向上させるために、衣装に依存しない特徴抽出(AIFL)フレームワークを提案する。本手法は、実際の衣装変更画像を合成するための新規な非教師あり衣装シミュレーションGAN(AS-GAN)を活用しており、実画像と合成画像のペアを用いた学習により特徴のロバスト性を向上させ、MSMT17およびC-MARSデータセットで顕著なmAPおよびCMCスコアの向上を達成した。人的なアノテーションを多く必要としない。

ABSTRACT

With the rise of deep learning methods, person Re-Identification (ReID) performance has been improved tremendously in many public datasets. However, most public ReID datasets are collected in a short time window in which persons' appearance rarely changes. In real-world applications such as in a shopping mall, the same person's clothing may change, and different persons may wearing similar clothes. All these cases can result in an inconsistent ReID performance, revealing a critical problem that current ReID models heavily rely on person's apparels. Therefore, it is critical to learn an apparel-invariant person representation under cases like cloth changing or several persons wearing similar clothes. In this work, we tackle this problem from the viewpoint of invariant feature representation learning. The main contributions of this work are as follows. (1) We propose the semi-supervised Apparel-invariant Feature Learning (AIFL) framework to learn an apparel-invariant pedestrian representation using images of the same person wearing different clothes. (2) To obtain images of the same person wearing different clothes, we propose an unsupervised apparel-simulation GAN (AS-GAN) to synthesize cloth changing images according to the target cloth embedding. It's worth noting that the images used in ReID tasks were cropped from real-world low-quality CCTV videos, making it more challenging to synthesize cloth changing images. We conduct extensive experiments on several datasets comparing with several baselines. Experimental results demonstrate that our proposal can improve the ReID performance of the baseline models.

研究の動機と目的

  • 人物再識別(Re-ID)において、モデルが衣装特徴に強く依存するという顕著な限界を解消し、衣装が変更された場合や類似衣装を着た場合に性能が低下することを防ぐ。
  • ショッピングモールのような長期間にわたるRe-ID状況においても耐性を持つ衣装に依存しない表現を学習する手法を開発する。
  • 最小限のラベル付きデータを活用する半教師ありフレームワークにより、高コストな人的アノテーションへの依存を低減する。
  • 低品質なCCTV画角からでさえも、GANを用いて衣装変更をシミュレートする現実的な画像合成パイプラインを構築する。
  • 衣装の変動が一般的な実世界環境において、Re-IDモデルの汎化性能とロバスト性を向上させる。

提案手法

  • 目的の衣装埋め込みを用いて、同じ人物が異なる服を着た画像を生成する非教師あり衣装シミュレーションGAN(AS-GAN)を提案する。
  • 標準的なConv2dブロックに代えて、画像のリアルさと特徴品質を向上させるための洗練された残差ブロックをAS-GANの生成器に導入する。
  • 実画像とAS-GANによる合成画像ペアを用いて初期化する半教師ありAIFLフレームワークを設計する。
  • AIFLにドメイン識別器$D_T$を組み込み、実画像ドメインと合成画像ドメインの間で特徴を統一することで、特徴の汎化性能を向上させる。
  • 2段階の訓練プロセスを採用する:まずAS-GANを画像ペアで事前学習し、その後、これらのペアを用いてReIDモデルを初期化した後、実データでファインチューニングを行う。
  • 合成画像ペアのデータ量を増やすことでスケーリングを実現し、段階的にモデル性能を向上させる。

実験結果

リサーチクエスチョン

  • RQ1低品質なCCTV画角から、GANベースの画像合成手法が、Re-IDのデータ拡張に適した現実的な衣装変更画像を効果的に生成できるか?
  • RQ2合成画像ペアと実画像ペアを用いた半教師あり学習が、人物再識別における衣装に依存しない特徴抽出を向上させるか?
  • RQ3ドメイン識別器$D_T$の導入が、学習されたReID特徴のロバスト性と汎化性能にどのように影響を与えるか?
  • RQ4合成画像ペアの数を増やすことで、分布シフトを損なわずにRe-ID性能がどの程度向上するか?
  • RQ5提案手法は、人的アノテーションデータへの依存を低減しつつ、mAPおよびCMCスコアを維持または向上させられるか?

主な発見

  • 洗練されたAS-GAN生成器を搭載したAIFLフレームワークは、MSMT17データセットでmAP 35.24%、CMC@1 65.96%を達成し、ベースラインモデルを上回った。
  • AS-GANに洗練された残差ブロックを導入することで、画像のリアルさが著しく向上し、その結果、標準的なConv2dブロックを用いた場合に比べてAIFLフレームワークの性能が向上した。
  • AIFLからドメイン識別器$D_T$を削除した場合、性能に顕著な低下が見られ、mAPは35.24%から31.61%に低下した。これは$D_T$がドメイン統一に重要な役割を果たしていることを証明している。
  • 合成画像ペアのセット数を1から5に増加させたことで、MSMT17におけるmAPは30.80%から35.24%に向上し、本手法のスケーラビリティを確認した。
  • 本手法は、合成データ生成後に限られたアノテーションのみを必要とするため、ラベル付きデータへの依存を著しく低減でき、実世界での展開に実用的である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。