Skip to main content
QUICK REVIEW

[論文レビュー] Pose-guided Feature Disentangling for Occluded Person Re-identification Based on Transformer

Tao Wang, Hong Liu|arXiv (Cornell University)|Dec 4, 2021
Human Pose and Action Recognition被引用数 16
ひとこと要約

本論文は、人体ポーズキーポイントの監視を活用して可視領域と遮蔽領域を明示的に分離する、トランスフォーマーに基づくポーズガイドド・フェイチャーディセンタングルング(PFD)ネットワークを提案する。PFAモジュール、デコーダー内の学習可能なセマンティックビュー、および新しいポーズガイドド・プッシュ損失を備えたポーズ・ビュー・マッチング(PVM)モジュールを統合することで、PFDは判別性の高い特徴を抽出し、ノイズの干渉を低減し、Occluded-Duke や Market-1501 を含む5つのベンチマークデータセットで最先端の性能を達成する。

ABSTRACT

Occluded person re-identification is a challenging task as human body parts could be occluded by some obstacles (e.g. trees, cars, and pedestrians) in certain scenes. Some existing pose-guided methods solve this problem by aligning body parts according to graph matching, but these graph-based methods are not intuitive and complicated. Therefore, we propose a transformer-based Pose-guided Feature Disentangling (PFD) method by utilizing pose information to clearly disentangle semantic components (e.g. human body or joint parts) and selectively match non-occluded parts correspondingly. First, Vision Transformer (ViT) is used to extract the patch features with its strong capability. Second, to preliminarily disentangle the pose information from patch information, the matching and distributing mechanism is leveraged in Pose-guided Feature Aggregation (PFA) module. Third, a set of learnable semantic views are introduced in transformer decoder to implicitly enhance the disentangled body part features. However, those semantic views are not guaranteed to be related to the body without additional supervision. Therefore, Pose-View Matching (PVM) module is proposed to explicitly match visible body parts and automatically separate occlusion features. Fourth, to better prevent the interference of occlusions, we design a Pose-guided Push Loss to emphasize the features of visible body parts. Extensive experiments over five challenging datasets for two tasks (occluded and holistic Re-ID) demonstrate that our proposed PFD is superior promising, which performs favorably against state-of-the-art methods. Code is available at https://github.com/WangTaoAs/PFD_Net

研究の動機と目的

  • 木や歩行者などの障害物に隠された人体の再識別という課題に対処すること。
  • グラフベースのポーズガイドド手法に起因する複雑さやノイズや類似した遮蔽に敏感な欠点を克服すること。
  • ポーズ監視を用いて、人体部と遮蔽特徴を明示的に分離することで、特徴学習を向上させること。
  • 埋め込み空間において可視部特徴と遮蔽部特徴を分離することで、遮蔽からの干渉を低減すること。
  • ノイズや不正確なポーズ推定に対しても頑健な性能を発揮し、異なるデータセット間で一般化できること。

提案手法

  • ビジョントランスフォーマー(ViT)エンコーダーが、強力な表現能力を持つグローバルパッチ特徴を抽出する。
  • ポーズガイドド・フェイチャーアグリゲーション(PFA)モジュールは、推定されたポーズのヒートマップとパッチ特徴を照合し、可視人体部を予備的に同定する。
  • パーツビューに基づくトランスフォーマー・デコーダーは、学習可能なセマンティックビューを導入し、分離された人体部特徴を暗黙的に強化する。
  • ポーズ・ビュー・マッチング(PVM)モジュールは、セマンティックビューとポーズガイドド特徴の間で最も類似した特徴を明示的に照合し、遮蔽特徴と人体特徴の自動分離を可能にする。
  • 新しいポーズガイドド・プッシュ損失が設計され、埋め込み空間において可視人体特徴と遮蔽特徴の類似度を最小化することで、ノイズ干渉を低減する。
  • 全体のフレームワークは、特徴の分離と再識別損失の共同最適化により、エンドツーエンドで訓練される。

実験結果

リサーチクエスチョン

  • RQ1トランスフォーマーに基づくアーキテクチャは、ポーズガイダンスを用いて、可視人体部と遮蔽領域を効果的に分離できるか?
  • RQ2学習可能なセマンティックビューとポーズガイドド特徴の明示的マッチングは、遮蔽あり再識別における特徴の判別性を向上させるか?
  • RQ3本手法は、現実世界のノイズや不正確なポーズ推定に対してどれほど頑健か?
  • RQ4ポーズガイドド・プッシュ損失は、遮蔽関連のノイズを効果的に抑制し、特徴学習を改善できるか?
  • RQ5本手法は、遮蔽ありおよび全体的な人物再識別ベンチマークの両方で良好に一般化できるか?

主な発見

  • PFDは、Occluded-Duke を含む5つのベンチマークデータセットで最先端の性能を達成し、ポーズ推定の閾値 γ を 0 に設定しても 65.5% の Rank-1 精度を達成しており、ポーズノイズに対して強い頑健性を示している。
  • 本手法は、HRNet、AlphaPose、OpenPose といった異なるポーズ推定モデルに対しても高い性能を維持しており、ポーズ品質のばらつきに対しても一般化できることを示している。
  • アブレーションスタディの結果、デコーダーのレイヤー数の最適値は 2 であり、17 個のセマンティックビューを超えると性能が頭打ちになる。これはキーポイント関節数と一致しており、効果的な特徴整合が実現されていることを示唆している。
  • PVMモジュールの閾値 γ は 0.2 で最も効果的であり、性能がピークに達する。値が低すぎるとノイズが影響し、高すぎると人体部が欠落するため、性能が低下する。
  • 注意メッシュの可視化により、学習されたセマンティックビューが正確に遮蔽のない人体領域を局在化していることが確認され、分離メカニズムの妥当性が裏付けられた。
  • ポーズガイドド・プッシュ損失は、可視部特徴と遮蔽部特徴の類似度を低減することで、特に困難な遮蔽状況下でも性能を顕著に向上させている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。