[論文レビュー] Part-Aware Transformer for Generalizable Person Re-identification
本稿では、人物再識別におけるドメイン一般化(DG-ReID)を目的とした、ビジョントランスフォーマーに基づくモデルであるPart-Aware Transformerを提案する。本手法は、IDに依存しない局所的視覚的類似性を異なるID間で抽出するためのCross-ID Similarity Learning(CSL)を導入し、ドメイン固有のバイアスへの過学習を低減する。さらに、局所的パーツ類似性を用いてガイドするPart-guided Self-Distillation(PSD)を採用し、グローバル特徴の一般化性能を向上させる。本手法は最先端の性能を達成し、Market→Duke設定においてRank-1を10.9%、mAPを12.8%向上させる。
Domain generalization person re-identification (DG-ReID) aims to train a model on source domains and generalize well on unseen domains. Vision Transformer usually yields better generalization ability than common CNN networks under distribution shifts. However, Transformer-based ReID models inevitably over-fit to domain-specific biases due to the supervised learning strategy on the source domain. We observe that while the global images of different IDs should have different features, their similar local parts (e.g., black backpack) are not bounded by this constraint. Motivated by this, we propose a pure Transformer model (termed Part-aware Transformer) for DG-ReID by designing a proxy task, named Cross-ID Similarity Learning (CSL), to mine local visual information shared by different IDs. This proxy task allows the model to learn generic features because it only cares about the visual similarity of the parts regardless of the ID labels, thus alleviating the side effect of domain-specific biases. Based on the local similarity obtained in CSL, a Part-guided Self-Distillation (PSD) is proposed to further improve the generalization of global features. Our method achieves state-of-the-art performance under most DG ReID settings. Under the Market$ o$Duke setting, our method exceeds state-of-the-art by 10.9% and 12.8% in Rank1 and mAP, respectively. The code is available at https://github.com/liyuke65535/Part-Aware-Transformer.
研究の動機と目的
- 未観測ドメインへのドメインシフトに直面する人物再識別において、モデルの一般化性能を向上させること。
- ビジョントランスフォーマーに基づくReIDモデルにおけるドメイン固有バイアスへの過学習を軽減すること。
- 異なるID間の内在的視覚的類似性を活用して、一般的でIDに依存しない局所的視覚表現を学習すること。
- 局所的パーツ類似性を用いてガイドする新しい自己ディスティルレーション戦略により、グローバル特徴の一般化性能を向上させること。
- 人物再識別におけるドメイン一般化のための純粋なトランスフォーマー基盤フレームワークを構築すること。
提案手法
- IDラベルを一切使用せずに、異なるID間の局所画像パーツ間の視覚的類似性を抽出する代理タスクとしてのCross-ID Similarity Learning(CSL)を導入する。
- パーツに依存するアテンションを用いて、関心領域内のパーツトークンと画像パッチを連結することで、局所的表現を生成する。
- メモリバンクを用いて、現在の局所的特徴とすべてのサンプルとの類似度を計算し、異なるID間で視覚的に類似したパーツを同定する。
- CSLの類似度結果を用いて、グローバル特徴のためのソフトラベルを構築するPart-guided Self-Distillation(PSD)を提案する。
- 訓練の安定化と局所的表現空間における特徴クラスタリングの向上を図るため、温度制御付きのソフトマックスクラスタリング損失を適用する。
- 浅層からのアテンションマップを統合することで、パーツトークンがバックパックやコートなど判別性の高い局所領域に注目していることを可視化・検証する。
実験結果
リサーチクエスチョン
- RQ1ビジョントランスフォーマーに基づくモデルは、CNNに比べてドメイン一般化の人物再識別においてより優れた一般化性能を達成できるか?
- RQ2IDに依存しない局所的視覚的類似性を学習することで、ドメインシフト下のReIDにおける一般化性能が向上するか?
- RQ3異なるID間の視覚的類似性に基づく代理タスクは、教師あり学習におけるドメイン固有バイアスへの過学習を低減できるか?
- RQ4局所的パーツ類似性を用いてガイドする自己ディスティルレーションは、細分化されたReIDタスクにおいて従来の自己ディスティルレーションを上回る性能を発揮するか?
- RQ5パーツトークンの数や温度ハイパーパrameterがモデル性能にどのように影響するか?
主な発見
- 提案されたPart-Aware Transformerは、Market→Duke、Market→CUHK03-NP、Market→MSMTを含む複数のDG-ReIDベンチマークで最先端の性能を達成した。
- Market→Duke設定において、前回の最先端手法に比べてRank-1精度を10.9%、mAPを12.8%向上させた。
- CSLモジュール単体でも顕著な性能向上を示し、IDに依存しない局所的類似性の学習の有効性を裏付けた。
- Part-guided Self-Distillation(PSD)はさらに一般化性能を向上させ、細分化されたReIDにおいて従来の自己ディスティルレーションよりも優れた性能を示した。従来手法は性能を低下させる傾向にあった。
- 最適な温度ハイパーパrameter τ = 0.02 がMarketデータセットで最高の性能を発揮した。非常に低い値や高い値では安定性が損なわれた。
- 画像を3つのパーツに分割すると最良の性能が得られ、より多いまたは少ないパーツ数ではわずかな向上しか得られず、適度な数のパーツトークンの有効性を確認した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。