Skip to main content
QUICK REVIEW

[論文レビュー] Discovering Underlying Person Structure Pattern with Relative Local Distance for Person Re-identification

Guangcong Wang, Jianhuang Lai|arXiv (Cornell University)|Jan 29, 2019
Video Surveillance and Tracking Methods参考文献 37被引用数 5
ひとこと要約

本稿では、ポーズアノテーションを必要とせずに人物再識別における人物構造をモデル化する、エンドツーエンドの新規手法である相対局所距離(RLD)を提案する。特徴マップから相対局所距離行列を計算し、それを正則化子として用いることで、構造に配慮したグローバル特徴の学習を強化し、Market-1501、CUHK03、DukeMTMC-reIDで最先端の性能を達成するとともに、トレーニングを高速化した。

ABSTRACT

Modeling the underlying person structure for person re-identification (re-ID) is difficult due to diverse deformable poses, changeable camera views and imperfect person detectors. How to exploit underlying person structure information without extra annotations to improve the performance of person re-ID remains largely unexplored. To address this problem, we propose a novel Relative Local Distance (RLD) method that integrates a relative local distance constraint into convolutional neural networks (CNNs) in an end-to-end way. It is the first time that the relative local constraint is proposed to guide the global feature representation learning. Specially, a relative local distance matrix is computed by using feature maps and then regarded as a regularizer to guide CNNs to learn a structure-aware feature representation. With the discovered underlying person structure, the RLD method builds a bridge between the global and local feature representation and thus improves the capacity of feature representation for person re-ID. Furthermore, RLD also significantly accelerates deep network training compared with conventional methods. The experimental results show the effectiveness of RLD on the CUHK03, Market-1501, and DukeMTMC-reID datasets. Code is available at \url{https://github.com/Wanggcong/RLD_codes}.

研究の動機と目的

  • 大きなポーズ変化や視点変化の下でも、高価なポーズアノテーションに依存せずに人物再識別における人物構造をモデル化する課題に取り組むこと。
  • 深層ネットワークに構造的インダクティブバイアスを統合し、人物再識別における特徴表現を向上させること。
  • 従来の手法と比較して性能を維持または向上させつつ、深層ネットワークのトレーニングを高速化すること。
  • グローバル特徴とローカル特徴表現のギャップを、人物画像内の相対的な空間的関係を学習することで埋めること。

提案手法

  • 畳み込み特徴マップの列方向特徴ベクトルから得られる相対局所距離(RLD)行列を導入し、構造的関係を捉える。
  • エンドツーエンドのトレーニングスキームにおいて、RLD行列を正則化子として用い、ネットワークが構造に配慮したグローバル特徴を学習するように誘導する。
  • 標準的な分類ネットワークに、相対局所距離制約を学習する小さな補助ブランチを追加する。
  • アイデンティティ分類損失と構造に配慮した損失を共同最適化することで、特徴の識別性を向上させる。
  • メインネットワークの後にグローバル平均プーリングを適用し、分類および構造学習用に全結合層を配置する。
  • パッチマッチング手法で一般的な反復的または非微分可能な演算の必要性を減らすことで、トレーニングを高速化する。

実験結果

リサーチクエスチョン

  • RQ1追加のポーズアノテーションを用いずに、人物再識別における潜在的な人物構造をモデル化できるか?
  • RQ2画像パッチ間の相対的局所距離をどのように活用することで、深層ネットワークにおけるグローバル特徴表現を改善できるか?
  • RQ3微分可能でエンドツーエンドで学習可能な構造正則化子は、人物再識別における精度とトレーニング速度の両面で改善をもたらせるか?
  • RQ4身体部位間の相対的な空間的関係を学習することで、ポーズや視点の変化に対して一般化性能が向上するか?

主な発見

  • RLDはMarket-1501で88.4%のランク-1と71.3%のmAPを達成し、部品アノテーションを一切使用しない最先端の手法を上回った。
  • Eraリランキング戦略を追加したRLD+Eraは、Market-1501で90.2%のランク-1と76.1%のmAPを達成し、最先端の結果を更新した。
  • CUHK03では、RLDが52.5%のランク-1と48.5%のmAPを達成し、SVDNet や PAN といった先行手法を顕著に上回った。
  • DukeMTMC-reIDでは、RLDが77.7%のランク-1と59.7%のmAPを達成し、異なるデータセット間でも強力な一般化性能を示した。
  • パッチマッチングに基づく手法と比較して、相対距離の計算が1枚の画像に対して微分可能であるため、トレーニング時間が短縮された。
  • 装飾的な技術を追加しなくても、最小限のアーキテクチャ変更で競争力のある性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。