[論文レビュー] Transformer Based Multi-Grained Features for Unsupervised Person Re-Identification
本論文は、自己教師あり人物再識別のため、ビジョントランスフォーマーベースのバックボーンから、グローバルおよびパーツレベルのマルチグレイン特徴を抽出するトランスフォーマー基盤のデュアルブランチネットワークを提案する。O2CAPフレームワークを用いてグローバルおよびパーツレベルの特徴の両方でオフラインおよびオンラインの対照的学習を統合することで、3つのベンチマークデータセットにおいて最先端の性能を達成し、教師あり手法との差を顕著に縮小した。
Multi-grained features extracted from convolutional neural networks (CNNs) have demonstrated their strong discrimination ability in supervised person re-identification (Re-ID) tasks. Inspired by them, this work investigates the way of extracting multi-grained features from a pure transformer network to address the unsupervised Re-ID problem that is label-free but much more challenging. To this end, we build a dual-branch network architecture based upon a modified Vision Transformer (ViT). The local tokens output in each branch are reshaped and then uniformly partitioned into multiple stripes to generate part-level features, while the global tokens of two branches are averaged to produce a global feature. Further, based upon offline-online associated camera-aware proxies (O2CAP) that is a top-performing unsupervised Re-ID method, we define offline and online contrastive learning losses with respect to both global and part-level features to conduct unsupervised learning. Extensive experiments on three person Re-ID datasets show that the proposed method outperforms state-of-the-art unsupervised methods by a considerable margin, greatly mitigating the gap to supervised counterparts. Code will be available soon at https://github.com/RikoLi/WACV23-workshop-TMGF.
研究の動機と目的
- 教師なし人物再識別の課題に対処する。これは、識別子のラベルが欠如しているが、実世界の展開に向け高い識別性能が求められる。
- 教師ありRe-IDにおけるCNNベースのマルチグレインネットのインスピレーションを受けて、純粋なトランスフォーマーベースのバックボーンがマルチグレイン特徴を抽出できる可能性を検討する。
- バックボーンを変更せずに、ビジョントランスフォーマーから同時にグローバルおよびパーツレベルの特徴を学習できるデュアルブランチアーキテクチャを設計する。
- O2CAPフレームワークを活用し、グローバルおよびパーツレベルの特徴の両方にオフラインおよびオンラインの対照的損失を定義することで、自己教師学習を強化し、表現学習を向上させる。
- ラベルなし環境でマルチグレイン特徴を効果的に活用することで、自己教師ありと教師ありRe-IDの性能差を縮小する。
提案手法
- 自己教師ありRe-ID用に適応された、変更を加えたビジョントランスフォーマー(ViT)であるTransReID-SSLバックボーンを、特徴抽出バックボーンとして採用する。
- 最終トランスフォーマーレイヤーを複製することでデュアルブランチネットワークを構築し、各ブランチに独立した出力を生成することで、並列な特徴学習を可能にする。
- 各ブランチから得た局所トークンを再形状し、均等に水平ストライプに分割してパーツレベル特徴を抽出する。
- 両ブランチからのグローバルトークンを平均化して、単一のグローバル特徴表現を生成する。
- O2CAPフレームワークを統合し、グローバルおよびパーツレベル特徴の両方にオフラインおよびオンラインの対照的学習損失を定義することで、偽ラベルの精錬と表現学習の向上を図る。
- 識別子の監視なしに、カメラに依存するプロキシと関連クラスタリングを活用して、対照的学習をガイドする。
実験結果
リサーチクエスチョン
- RQ1純粋なトランスフォーマーベースのRe-IDバックボーンから、自己教師あり設定においてマルチグレイン特徴を効果的に抽出できるか?
- RQ2グローバル特徴に加えてパーツレベルの対照的学習を組み合わせることで、グローバル特徴のみを用いる場合と比較して、自己教師あり人物Re-IDの性能が向上するか?
- RQ3ビジョントランスフォーマー上に構築されたデュアルブランチアーキテクチャは、細粒度特徴と長距離の文脈的手がかりを効率的に捉えることができるか?
- RQ4トランスフォーマー基盤の自己教師ありRe-IDモデルは、教師あり手法との性能差をどの程度縮小できるか?
- RQ5複数のベンチマークにおいて、提案手法は最先端の自己教師ありRe-ID手法と比較して、mAPおよびRank-1精度の点でどの程度優れているか?
主な発見
- MSMT17では、mAPが76.8%、Rank-1が92.9%を達成し、以前のSOTA自己教師あり手法O2CAPをmAPで15.8ポイント、Rank-1で11.3ポイント上回った。
- Market-1501では、mAPが89.5%、Rank-1が95.5%を達成し、教師ありA-BD-Netにわずかに劣るが、他の多数の教師あり手法を上回った。
- 正解ラベルを用いて学習したモデルは、Market-1501でmAPが91.9%、Rank-1が96.3%を達成し、マルチグレイン特徴抽出が極めて有効で、最先端の教師ありモデルと同等の性能を示した。
- 最も挑戦的であるMSMT17データセットでは、性能向上が顕著に現れ、TransReID-SSL(以前のSOTAのトランスフォーマー基盤自己教師あり手法)と比較してmAPで7.6ポイント、Rank-1で8.3ポイント向上した。
- アブレーションスタディの結果、グローバルおよびパーツレベルの対照的学習損失の両方が性能向上に寄与しており、特にパーツレベルの監視が最も顕著な改善をもたらした。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。