[論文レビュー] Dynamic Prototype Mask for Occluded Person Re-Identification
本稿では、追加の事前学習済みネットワークに依存しない、遮蔽された人物再識別のためのエンド・ツー・エンド枠組みである Dynamic Prototype Mask (DPM) を提案する。DPM は、高品質な統合的プロトタイプから可視特徴部分空間を選択する動的マスクを学習することで、その依存を排除する。階層的マスク生成器とヘッド強化モジュールを統合することで、プロトタイプ駆動型の自動特徴アライメントを実現し、遮蔽された ReID ベンチマークで最先端の性能を達成した。Occluded-Duke では、71.0% の rank-1 正答率と 61.0% の mAP を達成した。
Although person re-identification has achieved an impressive improvement in recent years, the common occlusion case caused by different obstacles is still an unsettled issue in real application scenarios. Existing methods mainly address this issue by employing body clues provided by an extra network to distinguish the visible part. Nevertheless, the inevitable domain gap between the assistant model and the ReID datasets has highly increased the difficulty to obtain an effective and efficient model. To escape from the extra pre-trained networks and achieve an automatic alignment in an end-to-end trainable network, we propose a novel Dynamic Prototype Mask (DPM) based on two self-evident prior knowledge. Specifically, we first devise a Hierarchical Mask Generator which utilizes the hierarchical semantic to select the visible pattern space between the high-quality holistic prototype and the feature representation of the occluded input image. Under this condition, the occluded representation could be well aligned in a selected subspace spontaneously. Then, to enrich the feature representation of the high-quality holistic prototype and provide a more complete feature space, we introduce a Head Enrich Module to encourage different heads to aggregate different patterns representation in the whole image. Extensive experimental evaluations conducted on occluded and holistic person re-identification benchmarks demonstrate the superior performance of the DPM over the state-of-the-art methods. The code is released at https://github.com/stone96123/DPM.
研究の動機と目的
- 実際の監視環境において、障害物が特徴的な身体部位を遮蔽するという、長年の遮蔽された人物再識別の課題に対処すること。
- キーポイントやパースリングのための追加の事前学習済みネットワークに依存することを排除し、ドメインギャップや誤差の伝播を低減すること。
- 人為的に設計された身体部位の監視に依存せずに、遮蔽アライメントを動的部分空間選択タスクに変換することで、自動的かつエンド・ツー・エンドで学習可能な特徴アライメントを実現すること。
- 複数のトランスフォーマーのヘッドにおける注意パターンの多様性を促進することで、プロトタイプ表現を強化すること。
提案手法
- 高品質な統合的プロトタイプから、階層的セマンティック特徴を用いて動的に可視パターン部分空間を選択する階層的マスク生成器 (HMG) を提案し、遮蔽された特徴の自動アライメントを可能にする。
- トランスフォーマー内の異なる注意ヘッドが、異なる空間パターンに注目するように明示的に促進するヘッド強化モジュール (HEM) を導入し、注意の相関を低減して特徴表現を豊かにする。
- L2正規化の前後にプロトタイプマスクを適用し、最終分類に必要な可視成分のみを確保する。
- ハイパーパrameter α と β を用いたマルチコンポonent損失関数を採用し、プロトタイプ学習、マスク学習、注意の多様性のバランスをとる。
- 固定または事前に定義された注目マップに依存せず、入力サンプルごとに可視コンテンツに応じて適応する動的マスク機構を採用する。
- ネットワーク全体をエンド・ツー・エンドで訓練することで、プロトタイプ学習、マスク生成、特徴表現の共同最適化を可能にする。
実験結果
リサーチクエスチョン
- RQ1遮蔽された人物再識別において、追加の事前学習済みネットワークを必要とせず、性能を維持または向上させることは可能か?
- RQ2人為的に設計された身体部位の監視に依存せず、自動的かつエンド・ツー・エンドで学習可能な特徴アライメントを実現する方法は何か?
- RQ3複数のトランスフォーマーのヘッドにおける注意パターンの多様性を促進することで、プロトタイプ表現を向上させることは可能か?
- RQ4プロトタイプ学習、マスク学習、注意の多様性をバランスさせる最適なハイパーパrameter α と β の設定は何か?
- RQ5L2正規化の前か後にプロトタイプにマスクを適用するほうが、性能が優れているか?
主な発見
- 提案された DPM は、Occluded-Duke データセットで 71.0% の rank-1 正答率と 61.0% の mAP を達成し、最先端の手法を上回った。
- プロトタイプ学習とマスク学習のバランスをとるための最適なハイパーパrameter α は 0.5 であり、それ以上に値を上げるとマスク学習への過剰な強調により性能が低下した。
- 注意の多様性を最適化するための最適なハイパーパラメータ β は 0.10 であり、mAP を最大にした一方で、高い rank-1 正答率を維持した。
- L2正規化の前に対応するプロトタイプにマスクを適用するほうが、正規化の後に適用するよりも性能が優れた。
- ヘッド強化モジュールにより、ヘッド間の注意相関が顕著に低下し、相関行列の値が低下したことが確認され、注意パターンの多様性が向上したことが裏付けられた。
- DPM フレームワークは、追加の事前学習済みネットワークを一切使用せず、遮蔽された実世界の再識別シナリオにおいて、高い頑健性と一般化性能を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。