Skip to main content
QUICK REVIEW

[論文レビュー] Pose Invariant Person Re-Identification using Robust Pose-transformation GAN

Arnab Karmakar, Deepak Mishra|arXiv (Cornell University)|Apr 11, 2021
Video Surveillance and Tracking Methods被引用数 4
ひとこと要約

本稿では、一連の入力画像から多様なポーズの人物画像を生成するロバストなポーズ変換 GAN(pt-GAN)を用いた、ポーズ不変性を持つ人物再識別フレームワークを提案する。さらに、ポーズクラスタリングと特徴融合を組み合わせることで、視点不変特徴を学習する。本手法は4つのベンチマークデータセットで最先端の性能を達成し、既存の GAN を用いたモデルおよび非 GAN モデルと比較して、精度とベースラインに対する向上率の両面で優れている。

ABSTRACT

The objective of person re-identification (re-ID) is to retrieve a person's images from an image gallery, given a single instance of the person of interest. Despite several advancements, learning discriminative identity-sensitive and viewpoint invariant features for robust Person Re-identification is a major challenge owing to the large pose variation of humans. This paper proposes a re-ID pipeline that utilizes the image generation capability of Generative Adversarial Networks combined with pose clustering and feature fusion to achieve pose invariant feature learning. The objective is to model a given person under different viewpoints and large pose changes and extract the most discriminative features from all the appearances. The pose transformational GAN (pt-GAN) module is trained to generate a person's image in any given pose. In order to identify the most significant poses for discriminative feature extraction, a Pose Clustering module is proposed. The given instance of the person is modelled in varying poses and these features are effectively combined through the Feature Fusion Network. The final re-ID model consisting of these 3 sub-blocks, alleviates the pose dependence in person re-ID. Also, The proposed model is robust to occlusion, scale, rotation and illumination, providing a framework for viewpoint invariant feature learning. The proposed method outperforms the state-of-the-art GAN based models in 4 benchmark datasets. It also surpasses the state-of-the-art models that report higher re-ID accuracy in terms of improvement over baseline.

研究の動機と目的

  • 人物再識別における大きなポーズ変動という主要な課題に対処し、特徴の識別性とモデルの精度を低下させる要因を軽減すること。
  • ポーズ変換による GAN ベースのデータ拡張を活用することで、小規模データセットにおけるディープラーニングモデルの限界を克服すること。
  • 単一のクエリ画像から視点不変特徴を学習できる、ロバストでエンドツーエンドで訓練可能なパイプラインの構築。
  • 遮蔽、照明の変化、スケール変動、回転などの実世界の条件下での一般化性能の向上。
  • ポーズ生成、クラスタリング、特徴融合を統合することで、最先端のモデルを上回る性能を達成すること。

提案手法

  • 一連の入力画像から任意の希望するポーズの人物画像を生成するポーズ変換 GAN(pt-GAN)を訓練し、洗練された損失関数と再識別データセットにおけるファインチューニングを用いる。
  • 特徴抽出のための最も識別的で代表的なポーズを特定するため、非教師ありポーズクラスタリングモジュールを実装し、冗長性を低減する。
  • 共有バックボーンネットワークを用いて、元のクエリ画像およびすべての生成されたポーズ変換画像から深層特徴を抽出する。
  • 学習可能な特徴融合ネットワーク(FusionNet)を用いて抽出された特徴を統合し、1つのロバストで視点不変の特徴ベクトルを生成する。
  • 統合された特徴ベクトルを用いてギャラリー集合における類似度ベースの検索を実行し、ポーズ不変マッチングを実現する。
  • GAN フレームワーク内にデータ拡張と CNN ベースの特徴学習を統合し、遮蔽、スケール、照明の変動に対する耐性を強化する。

実験結果

リサーチクエスチョン

  • RQ1GAN ベースのポーズ変換は、1枚の人物画像から多様で現実的であるポーズを効果的に生成できるか。これにより人物再識別の特徴のロバスト性が向上するか?
  • RQ2非教師ありポーズクラスタリングは、冗長性を最小限に抑えつつ識別性を最大化するための最も識別的なポーズをどのように特定できるか?
  • RQ3複数のポーズ変換画像間での特徴融合は、視点不変性と再識別精度をどの程度向上させるか?
  • RQ4提案されたエンドツーエンドフレームワークは、絶対精度およびベースラインモデルに対する向上率の両面で最先端のモデルを上回ることができるか?
  • RQ5遮蔽、照明の変化、スケール変動、検出エラーといった実世界の課題に対して、モデルの耐性はどの程度高いか?

主な発見

  • 提案手法は、Market-1501 で Rank-1 精度 73.2%、DukeMTMC-reID で 74.48%、CUHK03 で 83.3% を達成し、最先端の GAN ベースモデルを上回っている。
  • 再ランク処理を施すと、Market-1501 で 73.95%、DukeMTMC-reID で 93.04%、CUHK03 で 96.97% に向上し、強力なリtrieval 性能を示している。
  • Market-1501 ではベースラインの ResNet50-1 に対して 9.64% の向上を達成し、DukeMTMC-reID では 12.80% の向上を示しており、相対的な向上率においてより高い精度のモデルをも上回っている。
  • pt-GAN モデルは、遮蔽領域を効果的に再構築し、ポーズ間で身元の一貫性を維持しており、遮蔽および検出エラーに対して強い耐性を示している。
  • ポーズ、照明、回転の変動下でも、クラス内特徴距離はクラス間距離よりも顕著に低く抑えられており、モデルの不変性特性が裏付けられている。
  • 定性的な結果から、本手法は特に困難なポーズや遮蔽状況下でも、ベースラインモデルよりも正確に正しい身元を検索していることが示されている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。