Skip to main content
QUICK REVIEW

[論文レビュー] Intra-Inter Camera Similarity for Unsupervised Person Re-Identification

Shiyu Xuan, Shiliang Zhang|arXiv (Cornell University)|Mar 22, 2021
Video Surveillance and Tracking Methods参考文献 27被引用数 10
ひとこと要約

本論文は、畳み込みニューラルネットワーク(CNN)特徴量を用いたカメラ内でのクラスタリングと、クロスカメラ分類スコアを活用してドメインシフトを低減する二段階の偽ラベル化手法であるIntra-Inter Camera Similarity(IICS)を提案する。この手法により、特徴量の分布の違いに起因する偽ラベル品質の低下を軽減し、Market1501で89.5%のランク-1精度を達成。従来の非教師あり手法を9%以上上回り、教師あり転移学習手法と同等の性能を達成した。

ABSTRACT

Most of unsupervised person Re-Identification (Re-ID) works produce pseudo-labels by measuring the feature similarity without considering the distribution discrepancy among cameras, leading to degraded accuracy in label computation across cameras. This paper targets to address this challenge by studying a novel intra-inter camera similarity for pseudo-label generation. We decompose the sample similarity computation into two stage, i.e., the intra-camera and inter-camera computations, respectively. The intra-camera computation directly leverages the CNN features for similarity computation within each camera. Pseudo-labels generated on different cameras train the re-id model in a multi-branch network. The second stage considers the classification scores of each sample on different cameras as a new feature vector. This new feature effectively alleviates the distribution discrepancy among cameras and generates more reliable pseudo-labels. We hence train our re-id model in two stages with intra-camera and inter-camera pseudo-labels, respectively. This simple intra-inter camera similarity produces surprisingly good performance on multiple datasets, e.g., achieves rank-1 accuracy of 89.5% on the Market1501 dataset, outperforming the recent unsupervised works by 9+%, and is comparable with the latest transfer learning works that leverage extra annotations.

研究の動機と目的

  • カメラ間でのドメインシフトが、特徴量分布の不一致に起因して偽ラベル品質を低下させるという、非教師あり人物再識別における課題に対処すること。
  • 類似度計算をカメラ内とカメラ間の段階に分解することで、偽ラベルの信頼性を向上させること。
  • 生のCNN特徴量よりも頑健な特徴表現として、マルチカメラ分類器からの分類スコアを用いることで、カメラ間のドメインギャップを低減すること。
  • Adaptive Instance and Batch Normalization(AIBN)を用いて分類器の一般化能力を向上させ、カメラ間類似度推定の耐性を高めること。
  • ラベル付きソースデータや複雑なデータオーグメンテーションに依存せずに、完全に非教師ありの再識別で最先端の性能を達成すること。

提案手法

  • 第一段階:各カメラ内でCNN特徴量を用いてカメラ内類似度を計算し、クラスタリングにより偽ラベルを生成。これにより、共有バックボーンを持つマルチブランチ再識別モデルを訓練する。
  • 第二段階:各サンプルをC個の分類器(1カメラずつ)からの分類スコアのベクトルとして表現する。これは生の特徴量よりもドメインシフトに対して頑健である。
  • 分類スコアベクトルを用いてカメラ間類似度を計算し、外観の変化があっても信頼性の高いクラスタリングをカメラ間で実現する。
  • Adaptive Instance and Batch Normalization(AIBN)を導入し、分類器の一般化能力を向上させることで、カメラ間類似度の耐性を高める。
  • 再識別モデルを二段階で訓練する:まずカメラ内偽ラベルで、次にカメラ間偽ラベルで、洗練された類似度を用いて特徴学習を向上させる。
  • トレーニング中に再ランク付け類似度を適用することで、推論時間に影響を与えずに性能をさらに向上させる。

実験結果

リサーチクエスチョン

  • RQ1類似度計算をカメラ内とカメラ間の段階に分解することで、非教師あり人物再識別における偽ラベル品質が向上するか?
  • RQ2マルチカメラ分類器からの分類スコアを特徴表現として用いることで、カメラ間のドメインシフトの影響が軽減されるか?
  • RQ3弱教師あり設定下で、AIBNが分類器の一般化能力をどの程度向上させられるか?
  • RQ4生のCNN特徴量を用いたエンドツーエンドの類似度計算と比較して、提案手法のイントラインタカメラ類似度は再識別精度においてどのように優れているか?
  • RQ5完全に非教師ありの手法が、追加のアノテーションを用いる転移学習手法と同等の性能を達成できるか?

主な発見

  • 提案手法IICSは、Market1501で89.5%のランク-1精度を達成し、最近のすべての非教師あり手法を9ポイント以上上回った。
  • DukeMTMC-ReIDでは89.0%のランク-1精度を達成し、従来の非教師あり手法を大きく上回り、教師あり転移学習ベースラインに近い性能を示した。
  • より困難なMSMT17データセットでは、ラベルなしデータのみを用いて56.4%のランク-1精度を達成し、次善の手法(NRMT)を11.2ポイント以上上回った。
  • コサイン類似度の代わりに再ランク付け類似度を用いることで、MSMT17で73.4%のランク-1精度に向上し、強化された類似度計算の有効性を示した。
  • アブレーションスタディの結果、カメラ内およびカメラ間の段階の両方が性能向上に寄与しており、特にカメラ間段階がドメインシフトの低減に顕著に効果的であることが確認された。
  • AIBNの導入により、分類器の一般化能力が向上し、より信頼性の高いカメラ間類似度と改善された偽ラベル品質が得られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。