Skip to main content
QUICK REVIEW

[論文レビュー] STNReID : Deep Convolutional Networks with Pairwise Spatial Transformer Networks for Partial Person Re-identification

Hao Luo, Xing Fan|arXiv (Cornell University)|Mar 17, 2019
Video Surveillance and Tracking Methods参考文献 27被引用数 9
ひとこと要約

STNReID は、部分的画像と包括的画像をアフィン変換を学習することでアライメントする、ペアワイズ空間変換ネットワーク(STN)を用いた、部分的人物再識別のための新しい深層学習フレームワークを提案する。2段階の訓練戦略により、標準的な包括的ReIDデータセットのみを用いて訓練するが、Partial-ReID では66.7%のランク-1精度、Partial-iLIDS では54.6%を達成し、最先端の性能を発揮する。

ABSTRACT

Partial person re-identification (ReID) is a challenging task because only partial information of person images is available for matching target persons. Few studies, especially on deep learning, have focused on matching partial person images with holistic person images. This study presents a novel deep partial ReID framework based on pairwise spatial transformer networks (STNReID), which can be trained on existing holistic person datasets. STNReID includes a spatial transformer network (STN) module and a ReID module. The STN module samples an affined image (a semantically corresponding patch) from the holistic image to match the partial image. The ReID module extracts the features of the holistic, partial, and affined images. Competition (or confrontation) is observed between the STN module and the ReID module, and two-stage training is applied to acquire a strong STNReID for partial ReID. Experimental results show that our STNReID obtains 66.7% and 54.6% rank-1 accuracies on partial ReID and partial iLIDS datasets, respectively. These values are at par with those obtained with state-of-the-art methods.

研究の動機と目的

  • 遮蔽や視点の変化がある実世界の監視環境において、部分的画像と包括的画像をマッチングする課題に対処すること。
  • スライディングウィンドウマッチングやスパース再構成といった従来の手法が抱える高コストや非効率な1対1マッチングの制限を克服すること。
  • 追加の部分的画像アノテーションを必要とせず、標準的な包括的ReIDデータセットでの訓練を可能にすること。
  • 1対多バッチ推論を可能にすることでマッチング効率を向上させ、1対1マッチングに比べて時間コストを削減すること。
  • 2段階の訓練によりSTNモジュールとReIDモジュールの間で競合・最適化を繰り返すことで、空間アライメントを学習する耐障害性の高いフレームワークを開発すること。

提案手法

  • 部分的および包括的画像の高レベル特徴から、2次元アフィン変換パラメータ(スケーリング、回転、反転)を予測する空間変換ネットワーク(STN)モジュールを統合する。
  • STN を用いて、包括的画像から部分的画像に意味的にアライメントされたパッチ(アフィン変換画像)をサンプリングする。
  • ReIDモジュールを用いて、部分的画像およびアフィン変換画像からグローバル特徴を抽出し、マッチングを行う。
  • 2段階の訓練戦略を実装する:まず弱いReIDを最適化するためSTNを訓練し、次にSTNの予測結果を用いてReIDを微調整することでアライメントを向上させる。
  • 推論時にエンドツーエンドの1対多マッチングを可能にし、1つの部分的画像を1回の順伝播で複数の包括的画像と同時にマッチングすることで、効率性を向上させる。
  • 標準的な包括的ReIDデータセット(例:Market1501)を事前学習に活用し、追加のアノテーションなしに部分的ReIDにゼロショット適応を可能にする。

実験結果

リサーチクエスチョン

  • RQ1高レベル特徴のみを用いて、空間変換ネットワークが部分的画像と包括的画像を効果的にアライメントできるか?
  • RQ2STNとReIDモジュールが相互に競合・最適化する2段階の訓練戦略が、部分的ReIDベンチマークでの性能向上に寄与するか?
  • RQ3追加の部分的画像アノテーションを必要とせず、STNReIDが部分的ReIDデータセットで競争力のある性能を達成できるか?
  • RQ4DSRなどの既存手法と比較して、STNReIDの計算効率は、ギャラリーのサイズが変化する条件下でも優れているか?
  • RQ5標準データセットで学習したSTNReIDが、包括的ReIDタスクにどの程度一般化できるか?

主な発見

  • STNReID は Partial-ReID データセットで66.7%のランク-1精度を達成し、最先端の性能を再現した。
  • Partial-iLIDS データセットでは54.6%のランク-1精度を達成し、挑戦的な部分的ReIDベンチマークにおける強力な一般化性能を示した。
  • バッチサイズが大きくなるほど推論時間を顕著に短縮した:Partial-iLIDS では、N=1 の場合1.899秒からN=48 の場合0.303秒にまで短縮され、1対1マッチングを上回った。
  • Market1501 では93.8%のランク-1精度と84.9%のmAPを達成し、包括的ReIDタスクに対しても優れた性能を示した。
  • 2段階の訓練戦略により、STNとReIDモジュールの学習が効果的にバランスされ、モジュール干渉による性能低下を防いだ。
  • 1回の順伝播で1対多マッチングが可能となり、DSRのような1対1アプローチに比べてスケーラビリティに優れた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。