[論文レビュー] DomainMix: Learning Generalizable Person Re-Identification Without Human Annotations
本稿では、人為的アノテーションを一切不要とし、ラベル付き合成データとラベルなし実世界画像のみを用いて汎用性の高いモデルを学習する、人物再識別のための新規フレームワークDomainMixを提案する。ドメインバランス損失の導入と実画像の適応的クラスタリングにより、ドメインギャップを低減し、人為的アノテーションが一切ない実世界データを用いても、複数のベンチマークで最先端の性能を達成する。
Existing person re-identification models often have low generalizability, which is mostly due to limited availability of large-scale labeled data in training. However, labeling large-scale training data is very expensive and time-consuming, while large-scale synthetic dataset shows promising value in learning generalizable person re-identification models. Therefore, in this paper a novel and practical person re-identification task is proposed,i.e. how to use labeled synthetic dataset and unlabeled real-world dataset to train a universal model. In this way, human annotations are no longer required, and it is scalable to large and diverse real-world datasets. To address the task, we introduce a framework with high generalizability, namely DomainMix. Specifically, the proposed method firstly clusters the unlabeled real-world images and selects the reliable clusters. During training, to address the large domain gap between two domains, a domain-invariant feature learning method is proposed, which introduces a new loss,i.e. domain balance loss, to conduct an adversarial learning between domain-invariant feature learning and domain discrimination, and meanwhile learns a discriminative feature for person re-identification. This way, the domain gap between synthetic and real-world data is much reduced, and the learned feature is generalizable thanks to the large-scale and diverse training data. Experimental results show that the proposed annotation-free method is more or less comparable to the counterpart trained with full human annotations, which is quite promising. In addition, it achieves the current state of the art on several person re-identification datasets under direct cross-dataset evaluation.
研究の動機と目的
- 人為的アノテーションが限られた小規模データセットで学習された人物再識別モデルの一般化性能の低さを解決すること。
- 実世界のトレーニングデータに高価な人為的アノテーションに依存しないこと。
- 大規模なラベル付き合成データと多様なラベルなし実世界データを効果的に組み合わせることで、モデルの一般化性能を向上させること。
- アノテートされた実世界データを一切必要とせずに、合成データと実世界データの間のドメインギャップを低減すること。
- 未確認のターゲットドメインに対しても良好に一般化するスケーラブルでアノテーションフリーのトレーニングパラダイムを開発すること。
提案手法
- 各エポックにおいて、DBSCANを用いてラベルなし実世界画像をクラスタリングし、潜在的なアイデンティティを同定する。
- 滑らかさ、独立性、数量の3つの基準を用いて、ノイズの多いクラスタリング結果から信頼性の高いクラスタをフィルタリング・選択する。
- ドメイン不変特徴学習とドメイン識別を対戦的に学習するドメインバランス損失を導入する。
- 合成データと実世界データの間のドメインシフトを最小限に抑える一方で、人物再識別に有用な特徴を学習する統合モデルを訓練する。
- 各エポックで選択されたクラスタに含まれるアイデンティティ数に応じて動的に調整される適応的分類層の初期化を採用する。
- IBN-Net や OSNet-IBN などの多様なバックボーンアーキテクチャをフレームワークに統合し、広範な互換性を示している。
実験結果
リサーチクエスチョン
- RQ1人為的アノテーションが一切ない実世界トレーニングデータを用いても、人物再識別モデルが高い一般化性能を達成できるか?
- RQ2合成データと実世界データの間のドメインギャップを効果的に低減することで、モデルの一般化性能を向上させられるか?
- RQ3事前アノテーションなしで、ラベルなし実世界データのクラスタリングによって信頼性の高いアイデンティティを同定できるか?
- RQ4標準的なドメイン適応と比較して、対戦的ドメインバランス学習がドメイン間の特徴一般化を改善するか?
- RQ5提案されたフレームワークは、人為的アノテーションなしで直接のクロスデータセット評価において最先端の性能を達成できるか?
主な発見
- Market1501では43.5%のmAPと70.2%のrank-1を達成し、完全な人為的アノテーションを用いたモデルを上回る性能を示した。
- CUHK03-NPでは16.7%のmAPと18.0%のrank-1を達成し、実世界データのアノテーションなしで学習したすべてのベースラインを上回った。
- OSNet-IBNバックボーンを用いることで、Market1501で44.6%のmAPと72.9%のrank-1を達成し、提案されたアノテーションフリー設定下で新たなSOTAを樹立した。
- RandPersonの合成データとラベルなしMSMT17データを組み合わせた際、ベースラインモデルと比較して最大7.0%のmAP向上を達成した。
- ドメインバランス損失により、合成データと実世界データの間のドメインギャップが顕著に低減され、未確認ドメインへの一般化性能が向上した。
- データセット間で良好に一般化し、RandPersonとラベルなしMarket1501で学習した場合、MSMT17で13.6%のmAPと36.2%のrank-1という最先端の結果を達成した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。