Skip to main content
QUICK REVIEW

[論文レビュー] DEX: Domain Embedding Expansion for Generalized Person Re-identification

Eugene P.W. Ang, Shan Lin|arXiv (Cornell University)|Oct 21, 2021
Video Surveillance and Tracking Methods被引用数 5
ひとこと要約

本稿では、トレーニング中に人物ラベルとドメインラベルの両方を用いて深層特徴を動的に拡張することで、ドメイン一般化を向上させるドメイン埋め込み拡張モジュール DEX を提案する。DEX は微調整を必要とせず、未観測ドメインに対しても一般化性能を向上させ、すべての大規模ベンチマークで最先端手法を上回り、メモリ制約のある環境向けに効率的な学習が可能な DEXLite を併せて提供する。

ABSTRACT

In recent years, supervised Person Re-identification (Person ReID) approaches have demonstrated excellent performance. However, when these methods are applied to inputs from a different camera network, they typically suffer from significant performance degradation. Different from most domain adaptation (DA) approaches addressing this issue, we focus on developing a domain generalization (DG) Person ReID model that can be deployed without additional fine-tuning or adaptation. In this paper, we propose the Domain Embedding Expansion (DEX) module. DEX dynamically manipulates and augments deep features based on person and domain labels during training, significantly improving the generalization capability and robustness of Person ReID models to unseen domains. We also developed a light version of DEX (DEXLite), applying negative sampling techniques to scale to larger datasets and reduce memory usage for multi-branch networks. Our proposed DEX and DEXLite can be combined with many existing methods, Bag-of-Tricks (BagTricks), the Multi-Granularity Network (MGN), and Part-Based Convolutional Baseline (PCB), in a plug-and-play manner. With DEX and DEXLite, existing methods can gain significant improvements when tested on other unseen datasets, thereby demonstrating the general applicability of our method. Our solution outperforms the state-of-the-art DG Person ReID methods in all large-scale benchmarks as well as in most the small-scale benchmarks.

研究の動機と目的

  • 未学習のカメラネットワークに展開された教師あり人物再識別モデルにおける一般化の欠如を解消すること。
  • ターゲットドメインデータに対する微調整や適応を必要としないドメイン一般化ソリューションを開発すること。
  • トレーニング中にドメイン多様体上での特徴の暗黙的射影を活用することで、ドメインシフトに対するモデルのロバスト性を向上させること。
  • 大規模データセットおよびマルチブランチアーキテクチャへのスケーラビリティを向上させつつ、メモリ使用量を低減すること。
  • MGN や PCB、BagTricks といった既存の最先端アーキテクチャと互換性がある、即挿し可能なモジュールを提供すること。

提案手法

  • DEX はトレーニング中に人物ラベルとドメインラベルを用いて深層特徴を動的に操作し、ドメイン意味的拡張を生成する。
  • ラベル情報を利用して特徴空間の拡張を誘導することで、ドメイン多様体上での特徴の暗黙的射影を実現する。
  • 特徴の分離性とドメイン不変性を向上させるために、インスタンス正規化と学習可能なプロジェクションヘッドを適用する。
  • DEXLite はドメイン埋め込みを完全計算する代わりに負例サンプリングを適用することで、メモリ消費量を削減する。
  • 負例サンプリング戦略により、MGN や PCB のようなマルチブランチモデルに対しても DEXLite はスケーラブルである。
  • DEX および DEXLite は、アーキテクチャや損失関数の変更を必要とせず、既存モデルに即挿し可能な形で統合可能である。

実験結果

リサーチクエスチョン

  • RQ1人物ラベルとドメインラベルの二重ラベル誘導による深層特徴拡張は、未観測ドメインにおける人物再識別における一般化性能を向上させるか?
  • RQ2ターゲットデータに対する適応や微調整を要しない DEX は、ドメインシフトをどれほど効果的に低減できるか?
  • RQ3メモリ効率の良い DEX の変種(DEXLite)は、大規模データセットおよびマルチブランチアーキテクチャへのスケーリングを維持しながら性能を保持できるか?
  • RQ4DEX は MGN や PCB、BagTricks といった多様な最先端モデルにおいて一貫して性能向上をもたらすか?
  • RQ5DEXLite の最適な負例サンプルサイズは、性能と計算コストのバランスをとるためにどの程度か?

主な発見

  • ResNet-50 バックボーンとインスタンス正規化を用いた DEX は、すべての大規模ベンチマークで最先端のドメイン一般化手法を上回る性能を示した:Market-1501(81.5% mAP)、DukeMTMC-reID(72.7% mAP)、MSMT17_V2(34.3% mAP)、CUHK-NP(43.5% mAP)。
  • MGN や PCB に適用した場合、DEX は全ベンチマークで mAP を 2.8–4.6 パcent 点向上させ、アーキテクチャを問わず一貫した向上を示した。
  • DEXLite はたった 2,000 個の負例で、フル DEX と同等の性能を達成し、メモリ使用量と学習時間を顕著に削減した。
  • 小規模ベンチマークでは、DEXLite はトップパフォーマンス手法と同等またはそれを上回り、DukeMTMC-reID で最大 4.6%、CUHK-NP で 2.3% の mAP 向上を達成した。
  • アブレーションスタディにより、2,000 個を超える負例では性能が頭打ちになることが確認され、DEXLite のサンプリング戦略の効率性が裏付けられた。
  • DEX および DEXLite は、アーキテクチャの変更なしに、複数の最先端モデルの性能を向上させる即挿し可能なモジュールとして普遍的に適用可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。