Skip to main content
QUICK REVIEW

[論文レビュー] Person re-identification with fusion of hand-crafted and deep pose-based body region features

Jubin Johnson, Shunsuke Yasugi|arXiv (Cornell University)|Mar 27, 2018
Video Surveillance and Tracking Methods参考文献 1被引用数 10
ひとこと要約

本論文は、ポーズガイドドなボディ領域(頭部、体幹、脚)からのディープ特徴と、グローバル特徴バックボーンを用いた、手作業で作成された特徴(LOMO)を融合する人物再識別手法を提案する。ポーズ推定を活用して局所的特徴をアライメントし、判別的部分空間上でメトリック学習を適用することで、4つのベンチマークデータセットで最先端の性能を達成し、未学習のアイデンティティに対するゼロショット一般化性能を顕著に向上させる。

ABSTRACT

Person re-identification (re-ID) aims to accurately re- trieve a person from a large-scale database of images cap- tured across multiple cameras. Existing works learn deep representations using a large training subset of unique per- sons. However, identifying unseen persons is critical for a good re-ID algorithm. Moreover, the misalignment be- tween person crops to detection errors or pose variations leads to poor feature matching. In this work, we present a fusion of handcrafted features and deep feature representa- tion learned using multiple body parts to complement the global body features that achieves high performance on un- seen test images. Pose information is used to detect body regions that are passed through Convolutional Neural Net- works (CNN) to guide feature learning. Finally, a metric learning step enables robust distance matching on a dis- criminative subspace. Experimental results on 4 popular re-ID benchmark datasets namely VIPer, DukeMTMC-reID, Market-1501 and CUHK03 show that the proposed method achieves state-of-the-art performance in image-based per- son re-identification.

研究の動機と目的

  • 未学習のアイデンティティを対象としたゼロショット学習シナリオにおける人物再識別の課題に取り組む。
  • ポーズの変化、検出エラー、人物クロップにおけるアライメントのずれによって引き起こされる性能低下を軽減する。
  • 頭部、体幹、脚領域からの局所的でポーズガイドドな特徴とグローバルディープ特徴を融合することで、特徴表現を向上させる。
  • 補完的な手作業特徴(LOMO)とディープ特徴を組み合わせ、メトリック学習を適用することで、ドメインシフトを考慮した一般化性能を向上させる。
  • 粗粒度のボディパーツ(頭部、体幹、脚)が、細粒度のマイクロ領域よりも特徴融合において優れた性能を示すことを示す。

提案手法

  • ポーズ推定を用いてキーポイントを検出し、頭部、体幹、脚などの主要なボディ領域を切り出して、局所的特徴学習をガイドする。
  • ディープ畳み込みニューラルネットワーク(InceptionまたはResNet-50)が、各ボディ領域およびグローバル画像から特徴を抽出する。
  • 3つのボディ領域とグローバル画像からの特徴を連結して、統一された表現を構築する。
  • 手作業で作成されたLOMO特徴をディープ特徴と融合することで、判別力の向上を図る。
  • 判別的部分空間を学習するためのメトリック学習ステップ(XQDA)を適用し、距離マッチングの性能を向上させる。
  • ディープラーニングと手作業特徴の長所を組み合わせるため、訓練を分離した戦略を採用する。

実験結果

リサーチクエスチョン

  • RQ1ポーズガイドドなボディ領域からの手作業特徴とディープ特徴の融合は、未学習のアイデンティティにおける再識別性能を向上させるか?
  • RQ2ボディ領域の粒度(マクロ vs. マイクロ)の選択が、人物再識別における特徴融合の性能にどのように影響するか?
  • RQ3ボディパーツのポーズガイドドな局所化は、ポーズの変化や検出エラーが特徴マッチングに与える影響を軽減できるか?
  • RQ4グローバル特徴と局所的特徴の組み合わせは、ドメインシフトを伴うデータセット間でより良い一般化性能を示せるか?
  • RQ5提案手法の特徴融合戦略は、mAPおよびRank-1精度の観点で最先端手法と比較してどのように差をつけるか?

主な発見

  • 提案手法は、Market-1501でRank-1精度88.3%、mAP69.5%を達成し、グローバル特徴とSpindleNetの細粒度融合を上回る性能を示した。
  • LOMOとXQDAを提案手法に追加することで、VIPeRでmAPが91.1%、Rank-1が63.3%に向上し、すべてのベースラインを上回った。
  • 頭部、体幹、脚の3つのマクロ領域を用いた場合、7つのマイクロ領域を用いる場合よりも優れた性能を示し、mAPとRank-1でグローバル特徴よりも2%の向上を達成した。
  • DukeMTMC-reIDでは、提案された統合フレームワークを用いることで、mAP83.5%、Rank-166.1%という最先端の性能を達成した。
  • 定性的な結果から、顕著なポーズ変化、オクルージョン、シングルショット設定下でも、特にVIPeRおよびCUHK03で頑健なリトリーブ性能を示した。
  • ResNet-50はこの設定ではInceptionを上回らず、より深いネットワークが再識別において必然的に優れた一般化性能をもたらすとは限らないことを示唆した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。