Skip to main content
QUICK REVIEW

[論文レビュー] Multi-Scale Cascading Network with Compact Feature Learning for RGB-Infrared Person Re-Identification

Can Zhang, Hong Liu|arXiv (Cornell University)|Dec 12, 2020
Video Surveillance and Tracking Methods参考文献 23被引用数 8
ひとこと要約

本稿では、RGB赤外人物再識別のための新しいマージン指数中心(MeCen)損失を備えたマルチスケール部分認識段階的(MSPAC)ネットワークを提案する。段階的なアテンションを用いてマルチスケール部分特徴を階層的に統合し、MeCen損失によってモダリティ不変クラスタリングを強制することで、公開ベンチマーク上で最先端の性能を達成し、特にr=1の条件下で47.26% mAPを記録するなど、先行手法を大きく上回った。

ABSTRACT

RGB-Infrared person re-identification (RGB-IR Re-ID) aims to match persons from heterogeneous images captured by visible and thermal cameras, which is of great significance in the surveillance system under poor light conditions. Facing great challenges in complex variances including conventional single-modality and additional inter-modality discrepancies, most of the existing RGB-IR Re-ID methods propose to impose constraints in image level, feature level or a hybrid of both. Despite the better performance of hybrid constraints, they are usually implemented with heavy network architecture. As a matter of fact, previous efforts contribute more as pioneering works in new cross-modal Re-ID area while leaving large space for improvement. This can be mainly attributed to: (1) lack of abundant person image pairs from different modalities for training, and (2) scarcity of salient modality-invariant features especially on coarse representations for effective matching. To address these issues, a novel Multi-Scale Part-Aware Cascading framework (MSPAC) is formulated by aggregating multi-scale fine-grained features from part to global in a cascading manner, which results in a unified representation containing rich and enhanced semantic features. Furthermore, a marginal exponential centre (MeCen) loss is introduced to jointly eliminate mixed variances from intra- and inter-modal examples. Cross-modality correlations can thus be efficiently explored on salient features for distinctive modality-invariant feature learning. Extensive experiments are conducted to demonstrate that the proposed method outperforms all the state-of-the-art by a large margin.

研究の動機と目的

  • 劣悪な照明下におけるRGBと赤外画像間の大きなモダリティギャップに対処する。
  • 従来手法における限られたトレーニングデータと不十分なモダリティ不変特徴学習を克服する。
  • 細分化された部分レベル表現の強化により、特徴の区別能とクロスモダリティ相関性を向上させる。
  • 局所的な顕著特徴を複数スケールにわたって統合する包括的で階層的な特徴表現を開発する。
  • 複雑なハイブリッド制約に依存せずに、クラス内ばらつきとモダリティの不一致を新しい損失関数で除去する。

提案手法

  • グローバル特徴をマルチスケールの部分に分解し、各スケールでアテンション機構を適用することで、区別能の高い領域を強化するマルチスケール部分認識段階的(MSPAC)フレームワークを提案する。
  • 段階的な統合戦略を用いて、細分化された部分特徴を段階的に粗い表現に統合することで、空間的構造を保持するとともに意味的豊かさを向上させる。
  • 中心損失にマージンと指数重み付けを組み合わせた、マージン指数中心(MeCen)損失を導入し、困難なサンプルに対する制約を強化する。
  • MeCen損失は、同じIDのサンプルが異なるモダリティ間でよりコンパクトにクラスタリングされるようにすることで、クラス内ばらつきを最小化し、クロスモダリティ相関性を強化する。
  • グローバル平均プーリングとチャネル別アテンションを用いて、各スケールでの特徴を精緻化し、ポーズや視点の変化に対してより頑健にする。
  • モデルはMeCen損失を用いてエンドツーエンドで訓練され、特徴学習とモダリティ不変表現の共同最適化が可能になる。

実験結果

リサーチクエスチョン

  • RQ1マルチスケールで部分認識可能な特徴学習は、RGB赤外Re-IDにおける区別能の高い表現をどのように向上させるか?
  • RQ2部分特徴の段階的統合は、より頑健で包括的なグローバル表現をもたらすか?
  • RQ3提案されたMeCen損失は、標準的な中心損失と比較して、クラス内ばらつきとモダリティギャップをどれほど低減できるか?
  • RQ4MeCen損失は、限られたデータのRGB-IR Re-IDベンチマークでどれほど性能を向上させるか?
  • RQ5MSPACとMeCen損失の組み合わせは、複雑な画像および特徴レベルのハイブリッド制約の必要性を排除できるか?

主な発見

  • MSPAC-MeCenモデルは、r=1の条件下でSYSU-MM01データセットで47.26% mAPを達成し、すべての先行SOTA手法を大きく上回った。
  • 指数関数形(+exp)を備えたMeCen損失は、ベースラインからmAPを6.93ポイント向上させ、困難なサンプルのマイニングにおいて顕著な有効性を示した。
  • MeCen損失を用いることで、トップ1検索の精度が46.62%に達し、優れた性能を示した。
  • t-SNEによる可視化では、MeCen損失が2次元空間における同一ID特徴のよりコンパクトでモダリティに頑健なクラスタリングを実現していることが確認された。
  • MSPAC-MeCenのアテンションマップは、ヘッドや脚などの区別能の高い領域に焦点を当てており、背景のノイズよりも顕著に特徴づけられていることが、ベースラインモデルと比較して明らかになった。
  • アブレーションスタディでは、マージンと指数関数形を備えたMeCen損失が性能向上に不可欠であることが確認され、中心損失のみではわずかな向上にとどまった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。