[論文レビュー] Identity-Seeking Self-Supervised Representation Learning for Generalizable Person Re-identification
本論文は、4780万枚のラベルなし動画フレームから人間のアノテーションを一切用いずにドメイン一般化可能な人物再識別表現を学習する、アイデンティティ志向的自己教師付き表現学習(ISR)を提案する。フレーム間のアイデンティティ関連付けを最大重み二部マッチング問題として定式化し、信頼性誘導型対照的損失を用いることで、最先端の性能を達成し、ゼロショットドメイン一般化設定下でMarket-1501で87.0% Rank-1、MSMT17で56.4%を達成。それぞれ教師あり手法を5.0%および19.5%上回った。
This paper aims to learn a domain-generalizable (DG) person re-identification (ReID) representation from large-scale videos extbf{without any annotation}. Prior DG ReID methods employ limited labeled data for training due to the high cost of annotation, which restricts further advances. To overcome the barriers of data and annotation, we propose to utilize large-scale unsupervised data for training. The key issue lies in how to mine identity information. To this end, we propose an Identity-seeking Self-supervised Representation learning (ISR) method. ISR constructs positive pairs from inter-frame images by modeling the instance association as a maximum-weight bipartite matching problem. A reliability-guided contrastive loss is further presented to suppress the adverse impact of noisy positive pairs, ensuring that reliable positive pairs dominate the learning process. The training cost of ISR scales approximately linearly with the data size, making it feasible to utilize large-scale data for training. The learned representation exhibits superior generalization ability. extbf{Without human annotation and fine-tuning, ISR achieves 87.0\% Rank-1 on Market-1501 and 56.4\% Rank-1 on MSMT17}, outperforming the best supervised domain-generalizable method by 5.0\% and 19.5\%, respectively. In the pre-training$ ightarrow$fine-tuning scenario, ISR achieves state-of-the-art performance, with 88.4\% Rank-1 on MSMT17. The code is at \url{https://github.com/dcp15/ISR_ICCV2023_Oral}.
研究の動機と目的
- 人間によるアノテーションデータに依存せずにドメイン一般化可能な人物再識別表現を学習すること。
- 高コストなアノテーションのため、既存のドメイン一般化可能なReID手法が小規模なラベル付きデータセットに依存するという限界を克服すること。
- インターネット動画に存在するドメインの多様性を活用し、大規模な非教師あり動画データを活用して学習すること。
- ファインチューニングなしで未学習ドメインに即座に適用可能なReIDモデルの実現。
- アイデンティティ識別を学習するが、インスタンス識別ではなく、スケーラブルな自己教師付き手法の開発。
提案手法
- フレーム間のインスタンス関連付けを最大重み二部マッチング問題として定式化し、動画フレームからアイデンティティポジティブペアをマイニングする。
- フレーム間の最適マッチングに基づいてポジティブペアを構築し、同一アイデンティティの画像がまとめてグループ化されることを保証する。
- ノイズの多いポジティブペアを低減し、信頼性の高いペアを優先して学習する信頼性誘導型対照的損失を導入する。
- ネガティブ特徴を格納するメモリバンクを用い、異なるアイデンティティ間の特徴分離を促進する対照的損失を適用する。
- 同じ人物の異なる増幅ビューからの特徴を抽出するために、二重ブランチバックボーン(例:ResNet50 や Swin-Transformer)を採用する。
- データサイズに線形にスケーリング可能であり、最大4780万枚の画像に達する大規模な動画データセットでも効率的な学習が可能である。
実験結果
リサーチクエスチョン
- RQ1大規模なラベルなし動画からの自己教師付き表現学習が、アノテーションなしで最先端のドメイン一般化可能な人物再識別性能を達成できるか?
- RQ2アイデンティティラベルが存在しない状況で、単にフレームシーケンスのみを用いてアイデンティティ識別を効果的に学習できるか?
- RQ3ノイズの多いポジティブペアが表現学習に与える影響は何か? その悪影響をどのように軽減できるか?
- RQ4増加するラベルなし学習データ量に伴い、モデルの性能が向上するか?
- RQ5提案された信頼性誘導型対照的損失は、標準的なフォーカル損失に比べて、自己教師付き学習におけるノイズの多い監視を処理する上で優れているか?
主な発見
- ISRはゼロショットドメイン一般化設定下で、Market-1501で87.0% Rank-1、MSMT17で56.4%を達成し、最良の教師あり手法をそれぞれ5.0%および19.5%上回った。
- Swin-Transformerバックボーンを用いることで、ISRはMSMT17で56.4% Rank-1および30.3% mAPを達成し、より大きなモデルとのスケーラビリティが顕著に示された。
- 事前学習 → ファインチューニング設定において、ISRはMSMT17で88.4% Rank-1を達成し、新たな最先端を樹立した。
- Market-1501およびMSMT17の両性能は、データサイズの増加に伴い継続的に向上し、4億960万枚の画像に達しても飽和の兆しなし。
- 信頼性誘導型対照的損失はフォーカル損失を大きく上回り、信頼性の高いサンプルからの学習を誘導することが、ハードサンプルの重み付けよりも効果的であることを確認した。
- t-SNE可視化により、ISRはアイデンティティに特化した特徴を学習しており、同一アイデンティティの画像が密にクラスタリングされていることが確認された。一方、MoCoはインスタンス識別に特化した特徴を学習している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。