[論文レビュー] Factorized Distillation: Training Holistic Person Re-identification Model by Distilling an Ensemble of Partial ReID Models
本論文は、アンサンブルの部分的ReIDモデルから知識を蒸留することで、コン act な統合的person re-identification (ReID)モデルを訓練するFactorized Distillation (FD)を提案する。特徴マップとリtrieval特徴の両方を因子分解することで、特徴の連結とは異なり、複数の部分的モデルを模倣し、追加モジュールなしに強力な局所的注目を学習可能にし、より少ないパラメータで最先端の性能を達成する。
Person re-identification (ReID) is aimed at identifying the same person across videos captured from different cameras. In the view that networks extracting global features using ordinary network architectures are difficult to extract local features due to their weak attention mechanisms, researchers have proposed a lot of elaborately designed ReID networks, while greatly improving the accuracy, the model size and the feature extraction latency are also soaring. We argue that a relatively compact ordinary network extracting globally pooled features has the capability to extract discriminative local features and can achieve state-of-the-art precision if only the model's parameters are properly learnt. In order to reduce the difficulty in learning hard identity labels, we propose a novel knowledge distillation method: Factorized Distillation, which factorizes both feature maps and retrieval features of holistic ReID network to mimic representations of multiple partial ReID models, thus transferring the knowledge from partial ReID models to the holistic network. Experiments show that the performance of model trained with the proposed method can outperform state-of-the-art with relatively few network parameters.
研究の動機と目的
- 複雑なアーキテクチャを用いずに、強力な局所的特徴の識別を達成できるコンパクトな統合的ReIDモデルを訓練する課題に対処すること。
- 複数の部分的ReIDモデルから知識を一つの統合的生徒ネットワークに転送することで、難しいアイデンティティラベルの学習の難易度を軽減すること。
- 多くの教師モデルから蒸留する際の次元の爆発を避けるために、特徴の連結ではなく因子分解を用いること。
- ポーズ推定やパーツ検出ヘッドを明示的に追加することなく、通常のグローバル特徴ネットワークが識別的な局所的特徴を学習できるようにすること。
- 既存の大規模モデルと比べて顕著に少ないパラメータで最先端のReID性能を達成すること。
提案手法
- 複数の事前学習済み部分的ReIDモデル(例:4ストライプおよび7ストライプ分割)を教師として用い、監視的表現(SR)を生成する。SRは細粒度のソフトラベルとして機能する。
- SRはメトリック学習のアンカーとして使用される:生徒の特徴マップは、各SRの表現空間に一致するように因子分解される。これにより、局所的な知識転送が可能になる。
- 生徒ネットワークは、識別分類のためのクロスエントロピー損失、SRとの整合性を保つための属性学習損失、およびSRとの類似性を強制するメトリック学習損失を組み合わせた損失関数で訓練される。
- 特徴の因子分解は、特徴マップと最終的なリtrieval特徴の両方に対して適用され、高次元の特徴を連結することなく、複数の部分的モデルの注目パターンを模倣可能になる。
- フレームワークはスケーラブルで柔軟であり、ボディパーツマスクで学習したモデルやより強力な教師ネットワークなど、追加の教師モデルの統合が可能である。
- ドメイン一般化とクロスデータセット移行性を向上させるために、安定化されたグローバルメトリックプーリング(GMP)が使用される。
実験結果
リサーチクエスチョン
- RQ1複数の部分的ReIDモデルから知識を蒸留することで、コンパクトな統合的ReIDモデルが最先端の性能を達成できるか?
- RQ2特徴の連結に比べて、因子分解された蒸留が知識転送において優れているか、かつコンパクトなリtrieval特徴を維持できるか?
- RQ3明示的なパーツ検出やポーズ推定を追加せずに、標準的なグローバル特徴ネットワークが強力な局所的注目メカニズムを学習できるか?
- RQ4教師の数が性能に与える影響は何か?また、教師数の増加に対しても本手法はスケーラブルか?
- RQ5ターゲットドメインでのファインチューニングなしに、蒸留されたモデルが他のデータセットにうまく一般化できるか?
主な発見
- 27.7MパラメータのR50b+FDモデルは、70.3MパラメータのMGNよりもCUHK03で優れた性能を示し、Rank-1が95.07%、mAPが87.1%を達成し、パラメータ効率に優れていることが示された。
- 10Mパラメータ未満のグループでは、S+FD(2.7Mパラメータ)が、Market-1501でHA-CNN(14.8Mパラメータ)よりmAPで2.54%高く、DukeMTMCでは3.34%高い性能を示した。
- ホリスティックとパーシャルグループ1の教師に加えて、パーシャルグループ2の教師(7ストライプ分割)を追加することで性能が向上し、スケーラビリティと段階的向上が確認された。
- アブレーションスタディの結果、属性学習損失とメトリック学習損失の両方が性能向上に顕著に寄与しており、併用した場合が最も優れた結果を示した。
- クロスデータセット移行結果では、強力な一般化性能が確認された:R50b+FDは、ファインチューニングなしでMarket-1501でRank-1が44.75%、mAPが26.97%を達成し、SPGAN や PUL といったドメイン適応手法を上回った。
- ResNet-152バックボーンを搭載したモデルにFDを適用した場合、800万パラメータ少ないにもかかわらず、CUHK03でRank-1が95.07%、mAPが87.1%を達成し、MGNを上回った。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。