Skip to main content
QUICK REVIEW

[論文レビュー] CMTR: Cross-modality Transformer for Visible-infrared Person Re-identification

Tengfei Liang, Yi Jin|arXiv (Cornell University)|Oct 18, 2021
Video Surveillance and Tracking Methods参考文献 23被引用数 15
ひとこと要約

本稿では、可視・赤外線画像間のモダリティギャップを克服するためのクロスモダリティトランスフォーマー、CMTRを提案する。CMTRは、学習可能なモダリティ埋め込みと、新規のモダリティに適応した強化(MAE)損失を用いて、モダリティ固有の特徴を明示的にモデル化する。トランスフォーマー入力にモダリティ埋め込みを統合し、MAE損失で特徴分布を最適化することで、最も挑戦的なシングルショット設定下でSYSU-MM01およびRegDBで最先端の性能を達成し、Rank-1正答率80.62%、mAP73.75%を達成した。

ABSTRACT

Visible-infrared cross-modality person re-identification is a challenging ReID task, which aims to retrieve and match the same identity's images between the heterogeneous visible and infrared modalities. Thus, the core of this task is to bridge the huge gap between these two modalities. The existing convolutional neural network-based methods mainly face the problem of insufficient perception of modalities' information, and can not learn good discriminative modality-invariant embeddings for identities, which limits their performance. To solve these problems, we propose a cross-modality transformer-based method (CMTR) for the visible-infrared person re-identification task, which can explicitly mine the information of each modality and generate better discriminative features based on it. Specifically, to capture modalities' characteristics, we design the novel modality embeddings, which are fused with token embeddings to encode modalities' information. Furthermore, to enhance representation of modality embeddings and adjust matching embeddings' distribution, we propose a modality-aware enhancement loss based on the learned modalities' information, reducing intra-class distance and enlarging inter-class distance. To our knowledge, this is the first work of applying transformer network to the cross-modality re-identification task. We implement extensive experiments on the public SYSU-MM01 and RegDB datasets, and our proposed CMTR model's performance significantly surpasses existing outstanding CNN-based methods.

研究の動機と目的

  • 人物再識別における可視画像と赤外線画像の間の大きなモダリティギャップに対処すること。これは、効果的な特徴学習を妨げる。
  • CNNベースの手法が、モダリティ固有の特徴を十分に捉えられず、判別力のあるモダリティ不変特徴を学習できないという限界を克服すること。
  • 特徴学習中にモダリティ情報を明示的にモデル化することで、トランスフォーマーのアーキテクチャがクロスモダリティReIDにおいて果たせる可能性を調査すること。
  • モダリティ埋め込みの学習を強化し、クラス内コンパクト性とクラス間分離性を向上させる新しい損失関数の設計

提案手法

  • トランスフォーマー入力のパッチトークン埋め込みに、可視および赤外線モダリティの特徴を明示的に符号化するための学習可能なモダリティ埋め込み(ME)を導入する。
  • モダリティ埋め込みとパッチトークンを融合させ、自己注意計算中にモダリティ固有の特徴に注目できるようにする。
  • モダリティに適応したセンター損失(MAC)とモダリティに適応したID損失(MAID)から構成される、モダリティに適応した強化(MAE)損失を提案する。この損失は、MEからモダリティ固有の知識を除去することで、埋め込みを精錬する。
  • MAE損失内でモダリティ除去プロセスを採用し、埋め込みから学習済みのモダリティ情報を差し引くことで、モダリティ不変表現を抽出する。
  • 訓練中にMAE損失を適用し、埋め込み空間におけるクラス内距離を最小化し、クラス間距離を最大化する。
  • 浅層では共有されない、深層では共有される重みを持つ二本のストリームトランスフォーマーベースを採用し、モダリティ固有の特徴と共有特徴を両立させる。

実験結果

リサーチクエスチョン

  • RQ1モダリティ固有の特徴を明示的にモデル化することで、トランスフォーマーに基づくアーキテクチャが、可視・赤外線人物再識別においてモダリティ不変表現を効果的に学習できるか。
  • RQ2学習可能なモダリティ埋め込みを統合することで、標準のViTやCNNベースの手法と比較して、特徴表現がどのように向上するか。
  • RQ3モダリティに適応した強化(MAE)損失が、埋め込み空間におけるクラス内コンパクト性とクラス間分離性をどの程度向上させるか。
  • RQ4提案手法は、SYSU-MM01やRegDBといったベンチマークデータセットにおいて、既存の最先端CNNベースのモデルを上回る性能を示すか。
  • RQ5モダリティ埋め込みとMAE損失は、大きなモダリティギャップがある中でも、アイデンティティ不変特徴に注目できるように支援するか。

主な発見

  • CMTRは、最も挑戦的なシングルショット全探索設定下で、SYSU-MM01データセットにおいてRank-1正答率80.62%、mAP73.75%を達成し、以前の最先端CNNベース手法を顕著に上回った。
  • アブレーションスタディの結果、ベースラインのViTに比べて、モダリティ埋め込み(ME)を追加するだけで、Rank-1が3.12%、mAPが2.19%向上した。
  • モダリティに適応したセンター損失(MAC)はRank-1に+2.13%、mAPに+3.24%の寄与を示し、モダリティに適応したID損失(MAID)はRank-1に+3.13%、mAPに+2.57%の寄与を示した。これにより、両損失の相乗効果が明確に示された。
  • MAE損失全体を共同最適化することで、ベースライン比でRank-1が+5.18%、mAPが+5.17%向上し、特徴の判別性能向上の有効性を確認した。
  • t-SNE可視化により、MAE損失がクラス内クラスタをよりコンパクトにし、クラス間マージンを広くすることで、一般化性能の向上を実現していることが確認された。
  • Grad-CAM可視化により、MEを備えたCMTRが、赤外線画像では見えない場合でも、シャツの模様などのアイデンティティ不変特徴を効果的に捉えていることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。