Skip to main content
QUICK REVIEW

[論文レビュー] Deep High-Resolution Representation Learning for Cross-Resolution Person Re-identification

Guoqing Zhang, Yu Ge|arXiv (Cornell University)|May 25, 2021
Video Surveillance and Tracking Methods参考文献 78被引用数 102
ひとこと要約

本稿では、低解像度と高解像度の特徴間の分布差を低減するために、新規のVDSR-CA超解像モジュールとHRNet-ReID特徴抽出器を組み合わせた、クロス解像度person re-identificationのための深層ハイグレージョン疑似シアン方式PS-HRNetを提案する。本手法は、5つのベンチマークデータセットで最先端の性能を達成し、Rank-1精度を3.4%から6.2%まで向上させる。

ABSTRACT

Person re-identification (re-ID) tackles the problem of matching person images with the same identity from different cameras. In practical applications, due to the differences in camera performance and distance between cameras and persons of interest, captured person images usually have various resolutions. We name this problem as Cross-Resolution Person Re-identification which brings a great challenge for matching correctly. In this paper, we propose a Deep High-Resolution Pseudo-Siamese Framework (PS-HRNet) to solve the above problem. Specifically, in order to restore the resolution of low-resolution images and make reasonable use of different channel information of feature maps, we introduce and innovate VDSR module with channel attention (CA) mechanism, named as VDSR-CA. Then we reform the HRNet by designing a novel representation head to extract discriminating features, named as HRNet-ReID. In addition, a pseudo-siamese framework is constructed to reduce the difference of feature distributions between low-resolution images and high-resolution images. The experimental results on five cross-resolution person datasets verify the effectiveness of our proposed approach. Compared with the state-of-the-art methods, our proposed PS-HRNet improves 3.4\%, 6.2\%, 2.5\%,1.1\% and 4.2\% at Rank-1 on MLR-Market-1501, MLR-CUHK03, MLR-VIPeR, MLR-DukeMTMC-reID, and CAVIAR datasets, respectively. Our code is available at \url{https://github.com/zhguoqing}.

研究の動機と目的

  • 実世界の監視システムにおける解像度が不均一な人物画像同士のマッチングという課題に対処すること。
  • person re-IDにおける低解像度(LR)と高解像度(HR)の特徴分布間のドメインシフトを低減すること。
  • 超解像ネットワークにチャネルアテンションを統合することで、低解像度画像における特徴表現学習を向上させること。
  • re-IDに適した判別的でマルチスケールの特徴をより効果的に捉えることができる、特別に設計されたHRNetベースのバックボーン(HRNet-ReID)を設計すること。
  • 超解像とre-ID特徴を同時に最適化する疑似シアン学習戦略を構築すること。

提案手法

  • チャネルアテンションを備えた変更版VDSR(VDSR-CA)を提案し、周波数成分の回復を向上させるとともに、低解像度画像における意味的特徴学習を強化する。
  • HRNet-W32向けの新しい表現ヘッドであるHRNet-ReIDを導入し、person re-IDに適した効果的なマルチスケール特徴抽出を可能にする。
  • 2本のブランチ(HR画像用とLR画像用)を持つ疑似シアンフレームワークを採用し、トレーニング中に両者の特徴分布を統一する。
  • 2段階のトレーニング戦略を採用:まずHRNet-ReIDをHR-re-IDデータセットで事前学習し、その後、クロス解像度データセット上でVDSR-CAとHRNet-ReIDを共同で微調整する。
  • HRNet-ReIDヘッドで適応的平均プーリングと最大プーリングを適用し、高次元特徴マップを圧縮しながらも、テクスチャとグローバルコンテキストを保持する。
  • ネットワークの複数段階における特徴学習を最適化するため、シーケンスベースの損失関数(Seq(n), ℓc)を活用する。

実験結果

リサーチクエスチョン

  • RQ1チャネルアテンションを備えた軽量な超解像モジュールは、複雑なSRネットワークを上回る性能を発揮できるか?
  • RQ2標準のResNetベースのバックボーンと比較して、カスタム表現ヘッドを備えたHRNetは、クロス解像度re-IDにおける特徴の判別性を向上させるか?
  • RQ3疑似シアンフレームワークは、LRとHR特徴空間間の分布ギャップを効果的に低減できるか?
  • RQ4超解像モジュールとre-IDモジュールを共同で学習させることは、事前学習やエンドツーエンド学習よりも効果的か?
  • RQ5VDSR-CAとHRNet-ReIDの組み合わせは、複数のクロス解像度ベンチマークで優れた性能を発揮するか?

主な発見

  • PS-HRNetは5つのクロス解像度person re-IDベンチマークで最先端の性能を達成し、MLR-Market-1501ではRank-1精度が3.4%向上した。
  • VDSR-CAモジュールはSRCNNや元のVDSRを上回り、軽量な構造でありながらRCANと同等の結果を達成した。
  • HRNet-ReIDは、Market-1501およびDukeMTMC-reIDの両方で、HRNet-W32-CやResNet-50、DenseNet-121など他のバックボーンを顕著に上回った。
  • 疑似シアンフレームワークにおいて、Seq(1)、Seq(4)、Seq(5)、およびℓcの組み合わせが最良の性能を示し、MLR-Market-1501では91.5%のRank-1を達成した。
  • 疑似シアン構造におけるVDSR-CAとHRNet-ReIDの共同学習により、特徴分布のずれが低減され、一般化性能が向上した。
  • HRNet-ReIDで平均プーリングと最大プーリングの両方を適用することで、単独で使用する場合よりも高い認識精度が得られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。