Skip to main content
QUICK REVIEW

[論文レビュー] Frustratingly Easy Person Re-Identification: Generalizing Person Re-ID in Practice

Jieru Jia, Qiuqi Ruan|arXiv (Cornell University)|May 9, 2019
Video Surveillance and Tracking Methods参考文献 53被引用数 16
ひとこと要約

本論文は、ドメインの変化に起因するドメインシフトを軽減するため、初期層にインスタンス正規化(IN)を、深層層に特徴正規化(FN)を適用する、シンプルだが非常に効果的なドメイン一般化(DG)ベースラインを提案する。この手法は、トレーニング中にターゲットドメインデータを一切使用しない状態で、SOTAの即時性能を達成し、VIPeR、PRID、GRID、i-LIDSの各ベンチマークでそれぞれ11.8%、33.2%、12.8%、8.5%のランク-1精度向上を達成している。

ABSTRACT

Contemporary person re-identification ( eid) methods usually require access to data from the deployment camera network during training in order to perform well. This is because contemporary eid{} models trained on one dataset do not generalise to other camera networks due to the domain-shift between datasets. This requirement is often the bottleneck for deploying eid{} systems in practical security or commercial applications, as it may be impossible to collect this data in advance or prohibitively costly to annotate it. This paper alleviates this issue by proposing a simple baseline for domain generalizable~(DG) person re-identification. That is, to learn a eid{} model from a set of source domains that is suitable for application to unseen datasets out-of-the-box, without any model updating. Specifically, we observe that the domain discrepancy in eid{} is due to style and content variance across datasets and demonstrate appropriate Instance and Feature Normalization alleviates much of the resulting domain-shift in Deep eid{} models. Instance Normalization~(IN) in early layers filters out style statistic variations and Feature Normalization~(FN) in deep layers is able to further eliminate disparity in content statistics. Compared to contemporary alternatives, this approach is extremely simple to implement, while being faster to train and test, thus making it an extremely valuable baseline for implementing eid{} in practice. With a few lines of code, it increases the rank 1 eid{} accuracy by {11.8\%, 33.2\%, 12.8\% and 8.5\%} on the VIPeR, PRID, GRID, and i-LIDS benchmarks respectively. Source codes are available at \url{https://github.com/BJTUJia/person_reID_DualNorm}.

研究の動機と目的

  • 1つのデータセットでトレーニングされたモデルが、未知のカメラネットワークで失敗するという、人物再識別におけるドメインシフトの深刻な課題に対処すること。
  • ターゲットドメインデータやファインチューニングを必要とせず、新規の展開環境に一般化可能な実用的で即時のRe-IDソリューションを開発すること。
  • 複雑な最先端手法を凌駆する、最小限で効率的かつ安定したドメイン一般化手法を提案すること。
  • シンプルな正規化技術が、深層Re-IDモデルにおけるスタイルおよびコンテンツのドメインバイアスを効果的に軽減できることを示すこと。

提案手法

  • 照明、コントラスト、色 saturation などのスタイル変化をフィルタリングするため、初期畳み込み層にインスタンス正規化(IN)を適用する。
  • 視点、ポーズ、焦点距離の変化などのコンテンツ統計の乖離を低減するため、深層層に特徴正規化(FN)を適用する。
  • 最小限のアーキテクチャ変更で、標準的なCNNバックボーン(例:ResNet50 や MobileNetV2)にINとFNを統合し、数行のコード変更で実現可能である。
  • トレーニング中にターゲットドメインデータにアクセスできない状態で、ラベル付きソースドメインデータのみを用いてエンドツーエンドでモデルをトレーニングする。
  • 特徴エンコーディング後にペンダント層にFNを適用し、ドメイン間でグローバル特徴統計を正規化する。
  • スタイルとコンテンツの両方のドメインバイアスに同時に効果的に対処する二重正規化戦略を採用し、特徴の普遍性とドメインに依存しない表現を向上させる。

実験結果

リサーチクエスチョン

  • RQ1ターゲットドメインデータなしで、シンプルな正規化ベースのアプローチが、未知のカメラネットワークに一般化可能な人物再識別モデルを効果的に一般化できるか?
  • RQ2初期層にインスタンス正規化(IN)を、深層に特徴正規化(FN)を適用することで、スタイルおよびコンテンツの変化に起因するドメインシフトはどの程度軽減できるか?
  • RQ3提案手法のDualNormは、メタラーニングや教師なしドメイン適応の複雑な手法と比較して、ゼロショットドメイン一般化においてどのように性能を発揮するか?
  • RQ4提案手法は、ドメイン内再識別ベンチマークでも性能向上を示すか?これは、ドメイン内変動に対するロバストネスを示唆する。

主な発見

  • 提案手法のDualNormは、vanillaなResNet50と比較して、VIPeRベンチマークで11.8%のランク-1精度向上を達成した。
  • PRIDデータセットでは、ベースライン比で33.2%のランク-1精度向上を達成し、既存のDGおよび教師あり手法を顕著に上回った。
  • GRIDベンチマークでは43.7%のランク-1精度、i-LIDSでは78.2%のランク-1精度を達成し、多様なドメインにわたる強力な一般化性能を示した。
  • Market-1501 や DukeMTMC-reID といったドメイン内ベンチマークでも、それぞれ5.4%および6.2%のランク-1精度向上を達成し、クロスドメイン設定を超えた有効性を示した。
  • アブレーションスタディの結果、INとFNの組み合わせが補完的な利点をもたらし、初期層にIN、深層にFNを適用するアプローチが最も効果的であることが確認された。
  • DIMNのような既存のDG手法に比べ、メタラーニングや動的モデル合成を必要としないため、実世界の展開に向けた実用性が高く、高速かつシンプルである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。