[論文レビュー] Style Normalization and Restitution for Generalizable Person Re-identification
本論文は、一般化可能な人物再識別(ReID)のためのスタイル正規化と回復(SNR)モジュールを提案する。このモジュールは、インスタンス正規化(IN)を用いて、照明や色の変動といったスタイルのばらつきを抑える一方で、残差から顔認識に必要な特徴を蒸留・回復することで、識別能を維持する。SNRモジュールは、ドメイン一般化および教師なしドメイン適応のベンチマークで最先端の性能を達成し、先行手法よりも最大7.8%高いmAPを達成した。
Existing fully-supervised person re-identification (ReID) methods usually suffer from poor generalization capability caused by domain gaps. The key to solving this problem lies in filtering out identity-irrelevant interference and learning domain-invariant person representations. In this paper, we aim to design a generalizable person ReID framework which trains a model on source domains yet is able to generalize/perform well on target domains. To achieve this goal, we propose a simple yet effective Style Normalization and Restitution (SNR) module. Specifically, we filter out style variations (e.g., illumination, color contrast) by Instance Normalization (IN). However, such a process inevitably removes discriminative information. We propose to distill identity-relevant feature from the removed information and restitute it to the network to ensure high discrimination. For better disentanglement, we enforce a dual causal loss constraint in SNR to encourage the separation of identity-relevant features and identity-irrelevant features. Extensive experiments demonstrate the strong generalization capability of our framework. Our models empowered by the SNR modules significantly outperform the state-of-the-art domain generalization approaches on multiple widely-used person ReID benchmarks, and also show superiority on unsupervised domain adaptation.
研究の動機と目的
- 照明や色のコントラストといったスタイルのばらつきによって生じるドメインギャップのため、教師ありReIDの一般化性能が劣化する問題に対処すること。
- 識別に不要なスタイル特徴をフィルタリングしながらも、高い識別能力を維持すること。
- ターゲットドメインのデータやラベルにアクセスしないでも利用可能な、プラグアンドプレイ型のモジュールを開発すること。
- 最小限のアーキテクチャ変更で、効果的なドメイン一般化および教師なしドメイン適応を実現すること。
提案手法
- 人物画像における照明や色のコントラストといったスタイルのばらつきを抑えるために、インスタンス正規化(IN)を適用する。
- 正規化前の特徴と正規化後の特徴の残差から、正規化過程で失われた顔認識に必要な特徴を抽出する。
- 二重因果性損失を導入して分離を強制する:回復された特徴はより識別的で、正規化された特徴はより識別的でなくなるようにする。
- OSNetなどのReIDバックボーンにSNRモジュールをプラグアンドプレイ型で埋め込み、一般化性能を向上させる。
- MARなどの適応戦略と組み合わせることで、SNRモジュールを教師なしドメイン適応(UDA)のバックボーンとして使用する。
- MSMT17、Market1501、DukeMTMC、およびSYSU-MM01でのRGB-赤外再識別といった複数のベンチマークで手法を検証する。
実験結果
リサーチクエスチョン
- RQ1スタイル正規化のみで、顔認識の識別能を損なわせることなく、一般化性能を向上させることができるか?
- RQ2スタイル正規化後に得られる残差から、顔認識に必要な特徴を効果的に回復できるか?
- RQ3二重因果性損失は、ReID表現における顔認識関連特徴と顔認識に不要な特徴を効果的に分離できるか?
- RQ4SNRモジュールは、未観測のデータセットやクロスモダリティ設定を含む多様なドメインに一般化可能か?
- RQ5SNRはドメイン一般化および教師なしドメイン適応の両設定で性能を向上させることができるか?
主な発見
- SNRモジュールは最先端のドメイン一般化手法を著しく上回り、Market1501→DukeおよびDuke→Market1501の設定で、それぞれ6.9%および7.8%高いmAPを達成した。
- PRID、GRID、VIPeR、i-LIDSのベンチマークでは、SNRは2番目に良い手法であるDIMNよりもmAPを14.6%、6.6%、1.2%、11.5%向上させた。
- 教師なしドメイン適応(UDA)においてMARと組み合わせてバックボーンとして使用した場合、Market1501+Duke(U)→DukeおよびDuke+Market1501(U)→Market1501の設定で、2番目に良いUDA手法よりもmAPを3.8%および3.4%向上させた。
- SNRを強化したOSNet-SNRモデルは、M→DおよびD→Mの設定で、OSNet-IBNよりもmAPを5.0%および5.5%向上させた。
- 挑戦的なRGB-赤外クロスモダリティReIDタスク(SYSU-MM01)では、4つの設定すべてでmAPが8.4%から11.5%向上し、SOTA性能を達成した。
- SNRモジュールは複数のバックボーンおよび設定で一貫して性能を向上させ、強力な一般化性能とロバスト性を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。