Skip to main content
QUICK REVIEW

[論文レビュー] Multi-view Information Integration and Propagation for Occluded Person Re-identification

Neng Dong, Shuanglin Yan|arXiv (Cornell University)|Nov 7, 2023
Video Surveillance and Tracking Methods被引用数 4
ひとこと要約

本稿では、同一歩行者の複数の視点から得られる特徴マップを統合して包括的でノイズに強い表現を生成する、遮蔽された人物再識別のための新規フレームワーク、Multi-view Information Integration and Propagation (MVI²P) を提案する。CAMsに配慮した局所化と確率に配慮した定量による選択的で信頼性の高い統合に加え、訓練中に学習された包括的多視点表現から単一画像への知識蒸留を行う情報伝達メカニズムを採用することで、68.2%のRank-1および55.6%のmAPという最先端性能を達成し、パrameter数が少ないにもかかわらず複雑なモデルを上回る。

ABSTRACT

Occluded person re-identification (re-ID) presents a challenging task due to occlusion perturbations. Although great efforts have been made to prevent the model from being disturbed by occlusion noise, most current solutions only capture information from a single image, disregarding the rich complementary information available in multiple images depicting the same pedestrian. In this paper, we propose a novel framework called Multi-view Information Integration and Propagation (MVI$^{2}$P). Specifically, realizing the potential of multi-view images in effectively characterizing the occluded target pedestrian, we integrate feature maps of which to create a comprehensive representation. During this process, to avoid introducing occlusion noise, we develop a CAMs-aware Localization module that selectively integrates information contributing to the identification. Additionally, considering the divergence in the discriminative nature of different images, we design a probability-aware Quantification module to emphatically integrate highly reliable information. Moreover, as multiple images with the same identity are not accessible in the testing stage, we devise an Information Propagation (IP) mechanism to distill knowledge from the comprehensive representation to that of a single occluded image. Extensive experiments and analyses have unequivocally demonstrated the effectiveness and superiority of the proposed MVI$^{2}$P. The code will be released at \url{https://github.com/nengdong96/MVIIP}.

研究の動機と目的

  • 単一画像モデルが限られた可視部位と遮蔽ノイズの影響により失敗する、遮蔽された人物再識別の課題に対処すること。
  • 従来の単一画像再識別フレームワークで無視されがちな、同一歩行者の複数視点からの補完的情報を活用すること。
  • 遮蔽ノイズや関係のないコンテンツを抑圧しながら、多視点画像から信頼性の高い、判別能の高い情報のみを効果的に統合する手法を開発すること。
  • 訓練中に学習された包括的多視点表現から知識を蒸留することで、推論時に単一画像推論を可能にすること。
  • 外部モデルやデータオーグメンテーションに依存せず、最小限のモデル複雑性で最先端の性能を達成すること。

提案手法

  • 同じ歩行者の複数視点からの特徴マップを要素ごとの加算により統合し、包括的表現を形成する。
  • CAMsに配慮した局所化モジュールは、識別に寄与する空間的領域を特定・優先するため、クラス活性化マップ(CAMs)を用いる。
  • 確率に配慮した定量モジュールは、分類確信度に基づいて動的重みを特徴マップに割り当て、より信頼性の高い情報を強調する。
  • 情報伝達(IP)メカニズムは、推論時に包括的表現から単一の遮蔽画像へ知識を転送し、単一画像推論を可能にする。
  • ハイパーパrameter λ を用いた知識蒸留損失により、単一画像特徴表現を包括的表現と一致させ、識別精度を最適化する。
  • バックボーンにResNet-50を用い、追加の分類器を1つだけ導入することで、パrameter数(26.3M)が少なく、高い効率性を実現する。

実験結果

リサーチクエスチョン

  • RQ1同一歩行者の複数画像からの多視点情報は、遮蔽再識別における識別表現の向上に効果的に統合可能か?
  • RQ2多視点特徴統合の過程で、ノイズや関係のない情報(例:遮蔽物、非対象の人)はどのように除外可能か?
  • RQ3統合に最適な視点数は何か? また、その数は性能にどのように影響するか?
  • RQ4訓練時に学習された包括的多視点表現からの知識は、単一画像推論設定に効果的に転送可能か?
  • RQ5提案手法は、既存の最先端手法と比較して、より低いモデル複雑性で最先端の性能を達成できるか?

主な発見

  • MVI²Pは、Market-1501ベンチマークで68.2%のRank-1精度および55.6%のmAPを達成し、ベースラインおよび既存の最先端手法を上回った。
  • 知識蒸留の最適なハイパーパrameter λ は 0.007 であり、これによりRank-1とmAPの両方の性能が最大に向上した。
  • 4つの視点からの統合が最良の性能をもたらし、2つおよび8つの視点ではわずかな精度低下が見られた。これは情報の豊かさと冗長性の最適なバランスを示している。
  • わずか26.3Mパラメータで最先端の性能を達成し、FED(146.2M)やOPR-DAAO(58.2M)といった手法よりも顕著に効率的であることを示した。
  • データオーグメンテーションや外部モデルを一切使用しない状態でも、UMTS*(51.3Mパラメータ、58.6% Rank-1)やIGOAS(32.6Mパラメータ、60.1% Rank-1)を上回り、有効性と効率性を実証した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。