Skip to main content
QUICK REVIEW

[論文レビュー] Pose-guided Inter- and Intra-part Relational Transformer for Occluded Person Re-Identification

Zhongxing Ma, Yifan Zhao|arXiv (Cornell University)|Sep 8, 2021
Video Surveillance and Tracking Methods参考文献 52被引用数 10
ひとこと要約

本稿では、局所的パーツ関係とクロスパーツ相関をモデル化するために、キーポイントガイドド特徴グループ化と二重Transformerモジュールを活用した、遮蔽された人物再識別を目的としたポーズガイドド相互・内部パーツ関係変換器(PIRT)を提案する。本手法は、Occluded-DukeMTMCデータセットにおいて50.90 mAPおよび60.00% Rank-1の最先端性能を達成した。

ABSTRACT

Person Re-Identification (Re-Id) in occlusion scenarios is a challenging problem because a pedestrian can be partially occluded. The use of local information for feature extraction and matching is still necessary. Therefore, we propose a Pose-guided inter-and intra-part relational transformer (Pirt) for occluded person Re-Id, which builds part-aware long-term correlations by introducing transformers. In our framework, we firstly develop a pose-guided feature extraction module with regional grouping and mask construction for robust feature representations. The positions of a pedestrian in the image under surveillance scenarios are relatively fixed, hence we propose an intra-part and inter-part relational transformer. The intra-part module creates local relations with mask-guided features, while the inter-part relationship builds correlations with transformers, to develop cross relationships between part nodes. With the collaborative learning inter- and intra-part relationships, experiments reveal that our proposed Pirt model achieves a new state of the art on the public occluded dataset, and further extensions on standard non-occluded person Re-Id datasets also reveal our comparable performances.

研究の動機と目的

  • 全身の一部が欠落または損傷しているためにグローバル特徴が信頼できない、重度の遮蔽下における人物再識別の課題に対処すること。
  • キーポイント検出の不正確さや構造的モデリングの欠如により、弱い局所的特徴やずれが生じる既存手法の限界を克服すること。
  • 二重ブランチTransformerアーキテクチャを用いて、ポーズガイドド局所特徴と長距離依存性を統合することで、特徴表現を向上させること。
  • アテンションメカニズムを用いて、内部パーツ(局所的)および外部パーツ(クロスパーツ)関係をモデル化することで、遮蔽に対する耐性を高めること。
  • 遮蔽されたRe-IDベンチマークで最先端性能を達成するとともに、標準的なRe-IDデータセットに対しても良好な一般化性能を示すこと。

提案手法

  • 事前学習済みキーポイント検出器を用いて身体パーツを局所化し、キーポイント領域をより大きなマスクに拡張することで、頑健な特徴学習を実現するポーズガイドド特徴抽出モジュールを導入する。
  • キーポイント領域を3つの意味的パーツグループ(例:頭部、胴体、脚)にグループ化し、文脈に配慮した安定した局所特徴を形成する。
  • マスクガイドド特徴と自己アテンションを用いて、各グループ化されたパーツ内の局所的相関を学習する内部パーツ関係変換器を設計する。
  • パーツノード間のクロスアテンションを用いて、グループ化されたパーツ間のクロスパーツ関係をモデル化する外部パーツ関係変換器を開発する。
  • 照合意思決定を精緻化するために、クエリ画像およびギャラリー画像からの信頼度スコアを統合し、さまざまな遮蔽レベル下での耐性を向上させる。
  • トライオレット損失とクロスエントロピー損失の組み合わせを用いて、グローバルおよび局所的特徴表現の最適化を実現する。

実験結果

リサーチクエスチョン

  • RQ1遮蔽下での耐性を高めるために、どのようにポーズガイドド局所特徴を効果的にグループ化・強化できるか?
  • RQ2変換器を用いた内部パーツおよび外部パーツ関係モデリングは、遮蔽されたRe-IDにおける特徴表現をどの程度向上させ得るか?
  • RQ3このタスクにおいて、精度と計算効率のバランスをとる最適な変換器ユニット数は何か?
  • RQ4クエリおよびギャラリー画像からの信頼度スコアは、部分的遮蔽下での照合性能にどのように影響を与えるか?
  • RQ5提案手法は遮蔽データセットに限らず、標準的なRe-IDベンチマークでも競争力のある性能を達成できるか?

主な発見

  • 提案されたPIRTモデルは、Occluded-DukeMTMCデータセットにおいて50.90% mAPおよび60.00% Rank-1の精度で、新たな最先端性能を達成した。
  • アブレーションスタディの結果、内部パーツおよび外部パーツ関係変換器を併用したモデルが最も高い性能を示し、片方の変換器のみまたは両方を用いないモデルを上回った。
  • クエリおよびギャラリー画像からの信頼度スコアを統合することで、信頼度スコアを一切使用しない場合と比較して、mAPが2.71%向上した。
  • 3つの変換器ユニットを搭載したモデルが最適な性能を示した。4ユニット以上の深層ネットワークでは、トレーニングの不安定性によりmAPがわずかに低下した。
  • 本手法は非遮蔽データセットに対しても良好に一般化でき、標準的なRe-IDベンチマークで既存の最先端手法と同等の競争力ある結果を達成した。
  • 可視化結果から、内部パーツ関係モジュールがグループ化された身体パーツ内の局所的構造的パターンを効果的に捉えており、識別性の高い特徴学習を強化していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。