Skip to main content
QUICK REVIEW

[論文レビュー] Surpassing Real-World Source Training Data: Random 3D Characters for Generalizable Person Re-Identification

Yanan Wang, Shengcai Liao|arXiv (Cornell University)|Jun 23, 2020
Video Surveillance and Tracking Methods参考文献 31被引用数 6
ひとこと要約

本論文では、Unity3Dを用いた自動3Dキャラクターシンセシスと仮想監視環境を用いて生成された大規模な合成人物再識別データセット、RandPersonを提案する。RandPersonで訓練したモデルは、Market-1501、DukeMTMC-reID、さらにはMSMT17といった実世界のベンチマークでも最先端の性能を上回り、合成データが実世界の訓練データよりも優れた一般化を可能にできることを示している。

ABSTRACT

Person re-identification has seen significant advancement in recent years. However, the ability of learned models to generalize to unknown target domains still remains limited. One possible reason for this is the lack of large-scale and diverse source training data, since manually labeling such a dataset is very expensive and privacy sensitive. To address this, we propose to automatically synthesize a large-scale person re-identification dataset following a set-up similar to real surveillance but with virtual environments, and then use the synthesized person images to train a generalizable person re-identification model. Specifically, we design a method to generate a large number of random UV texture maps and use them to create different 3D clothing models. Then, an automatic code is developed to randomly generate various different 3D characters with diverse clothes, races and attributes. Next, we simulate a number of different virtual environments using Unity3D, with customized camera networks similar to real surveillance systems, and import multiple 3D characters at the same time, with various movements and interactions along different paths through the camera networks. As a result, we obtain a virtual dataset, called RandPerson, with 1,801,816 person images of 8,000 identities. By training person re-identification models on these synthesized person images, we demonstrate, for the first time, that models trained on virtual data can generalize well to unseen target images, surpassing the models trained on various real-world datasets, including CUHK03, Market-1501, DukeMTMC-reID, and almost MSMT17. The RandPerson dataset is available at https://github.com/VideoObjectSearch/RandPerson.

研究の動機と目的

  • 実世界の訓練データに多様性と規模の不足により、人物再識別モデルの未観測ターゲットドメインへの一般化性能が制限されている問題に対処すること。
  • 大規模な実世界の人物再識別データセットを手動でアノテートする際の高コストとプライバシー懸念を克服すること。
  • 多様な3Dキャラクターや仮想監視環境を自動的に生成するスケーラブルで自動化されたパイプラインを開発すること。
  • 完全に合成データで訓練されたモデルが、実世界データで訓練されたモデルよりも一般化性能が優れているかどうかを評価すること。
  • 合成データが人物再識別において実データと補完的であり、場合によっては実データを上回ることを実証すること。

提案手法

  • 自動的にランダムなUVテクスチャマップを生成し、キャラクターシンセシス用の多様な3D衣装モデルを作成する。
  • 手続き的生成を用いて、人種、属性、衣装にばらつきを持つ8,000体のユニークな3Dキャラクターを自動で生成するコードベースを開発する。
  • 照明、背景、解像度の異なる屋内・屋外シーンを含む、現実的な仮想環境をUnity3Dでシミュレートする。
  • 実際の監視システムに類似したマルチカメラネットワークを実装し、複数の3Dキャラクターが異なる経路を同時に移動する様子を捉える。
  • 多様な視点、ポーズ、隠蔽状況、環境的条件下で、8,000人のアイデンティティの人物1,801,816枚の画像をレンダリングする。
  • 人物再識別モデルを合成データのRandPersonデータセットのみで訓練し、実世界のベンチマークで評価する。

実験結果

リサーチクエスチョン

  • RQ1完全に合成データで訓練された人物再識別モデルは、実世界データで訓練されたモデルよりも一般化性能が優れているか?
  • RQ2RandPersonからの合成データの統合が、実世界データで訓練されたモデルの性能に与える影響は何か?
  • RQ3合成データにおける環境の多様性とアイデンティティ数が、モデルの一般化に与える影響の程度はどの程度か?
  • RQ4RandPersonにおける合成データの分布は、実世界監視で見られるドメイン変動を効果的にカバーしているか?
  • RQ5複数人・複数カメラの複雑なシーンを含む合成データは、単一人物・単一カメラのデータに比べ、モデルのロバスト性を向上させられるか?

主な発見

  • RandPersonの合成データセットのみで訓練したモデルは、CUHK03、Market-1501、DukeMTMC-reID、およびほぼMSMT17を含む実世界データセットのクロスデータセット評価において、実世界データで訓練したモデルを上回る性能を示した。
  • 実世界データセットと融合した場合、複数のベンチマークでRank-1正答率が5.2%から24.9%へ、mAPが2.8%から19.6%へ向上した。
  • 同じドメイン内でも、CUHK03のみで訓練した場合と比較して、RandPersonのみで訓練した場合、Rank-1正答率が28.9%向上、mAPが24.6%向上した。
  • 実世界データと融合した場合、RandPersonで訓練したモデルの性能は、Rank-1で最大13.4%、mAPで最大12.7%向上した。これにより、相乗効果の存在が確認された。
  • RandPersonのシーン数やアイデンティティ数が増えるにつれて性能が段階的に向上したが、一定数のシーンに達すると飽和が見られ、MSMT17ではドメインギャップのため過学習が観察された。
  • 結果から、多様で複数人・複数カメラの監視シミュレーションを含む合成データは、ドメインシフトを効果的に低減し、モデルの一般化性能を向上させられることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。