[논문 리뷰] Surpassing Real-World Source Training Data: Random 3D Characters for Generalizable Person Re-Identification
이 논문은 Unity3D에서 자동화된 3차원 캐릭터 합성과 가상 감시 환경을 사용하여 생성한 대규모 합성 인물 재식별 데이터셋인 RandPerson을 제안한다. RandPerson으로 훈련시킨 모델들은 Market-1501, DukeMTMC-reID, 그리고 거의 MSMT17와 같은 실제 환경 벤치마크에서 최신 기술을 초월하며, 합성 데이터가 실제 훈련 데이터보다 우수한 일반화 성능을 가능하게 한다는 것을 보여준다.
Person re-identification has seen significant advancement in recent years. However, the ability of learned models to generalize to unknown target domains still remains limited. One possible reason for this is the lack of large-scale and diverse source training data, since manually labeling such a dataset is very expensive and privacy sensitive. To address this, we propose to automatically synthesize a large-scale person re-identification dataset following a set-up similar to real surveillance but with virtual environments, and then use the synthesized person images to train a generalizable person re-identification model. Specifically, we design a method to generate a large number of random UV texture maps and use them to create different 3D clothing models. Then, an automatic code is developed to randomly generate various different 3D characters with diverse clothes, races and attributes. Next, we simulate a number of different virtual environments using Unity3D, with customized camera networks similar to real surveillance systems, and import multiple 3D characters at the same time, with various movements and interactions along different paths through the camera networks. As a result, we obtain a virtual dataset, called RandPerson, with 1,801,816 person images of 8,000 identities. By training person re-identification models on these synthesized person images, we demonstrate, for the first time, that models trained on virtual data can generalize well to unseen target images, surpassing the models trained on various real-world datasets, including CUHK03, Market-1501, DukeMTMC-reID, and almost MSMT17. The RandPerson dataset is available at https://github.com/VideoObjectSearch/RandPerson.
연구 동기 및 목표
- 실제 훈련 데이터의 다양성과 규모가 부족하여 인물 재식별 모델이 새로운 타겟 도메인으로의 일반화 능력이 제한되는 문제를 해결하기 위해.
- 대규모 실제 인물 재식별 데이터셋을 수동으로 레이블링하는 데 드는 높은 비용과 개인정보 문제를 해결하기 위해.
- 다양한 3차원 캐릭터와 가상 감시 환경을 자동으로 생성하기 위한 확장 가능한, 자동화된 파이프라인 개발을 위해.
- 순수하게 합성 데이터로 훈련한 모델이 실제 데이터로 훈련한 모델보다 더 우수한 일반화 성능을 보이는지 평가하기 위해.
- 합성 데이터가 인물 재식별에 있어 실제 데이터와 보완적이거나 심지어 그에 뛰어선다는 것을 입증하기 위해.
제안 방법
- 자기주도적으로 랜덤 UV 텍스처 매핑을 생성하여 캐릭터 합성에 사용할 다양한 3차원 의복 모델을 제작하기 위해.
- 절차적 생성을 사용하여 인종, 특성, 복장이 다른 8,000개의 고유한 3차원 캐릭터를 자동으로 생성하기 위한 코드베이스를 개발하기 위해.
- 실제 감시 환경을 모방하는 실감 나는 가상 환경을 Unity3D에서 시뮬레이션하여, 다양한 조명, 배경, 해상도를 갖춘 실내 및 실외 장면을 구현하기 위해.
- 실제 감시 시스템을 모방하는 다중 카메라 네트워크를 구현하여, 서로 다른 경로를 따라 여러 3차원 캐릭터의 동시 이동을 캡처하기 위해.
- 다양한 시점, 자세, 가림, 환경 조건을 고려하여 총 8,000명의 신원에 대해 1,801,816장의 인물 이미지를 렌더링하기 위해.
- 인물 재식별 모델을 순수하게 합성된 RandPerson 데이터셋에서만 훈련시키고, 실제 환경 벤치마크에서 평가하기 위해.
실험 결과
연구 질문
- RQ1순수하게 합성 데이터로 훈련한 인물 재식별 모델이 실제 데이터로 훈련한 모델보다 더 우수한 일반화 성능을 보일 수 있는가?
- RQ2RandPerson에서 유래한 합성 데이터의 포함 여부가 실제 데이터셋에서 훈련된 모델의 성능에 어떤 영향을 미치는가?
- RQ3합성 데이터의 환경 다양성과 신원 수가 모델의 일반화 능력에 얼마나 큰 영향을 미치는가?
- RQ4RandPerson의 합성 데이터 분포가 실제 감시 환경에서 관찰되는 도메인 변량을 효과적으로 커버하는가?
- RQ5복잡한 다중 인물, 다중 카메라 시나리오를 가진 합성 데이터가 단일 인물, 단일 카메라 데이터보다 모델의 강인성을 향상시키는가?
주요 결과
- RandPerson 합성 데이터셋에서만 훈련한 모델은 CUHK03, Market-1501, DukeMTMC-reID, 거의 MSMT17를 포함한 실제 데이터셋에서의 교차 데이터셋 평가에서 최신 기술을 초월한다.
- 실제 데이터셋과 융합했을 때, RandPerson은 여러 벤치마크에서 순위 1 정확도를 5.2%에서 24.9%로, mAP를 2.8%에서 19.6%로 향상시켰다.
- 동일한 도메인 내에서도, CUHK03에서만 훈련한 것과 비교해 RandPerson에서만 훈련한 경우 순위 1 정확도가 28.9% 향상되었고, mAP는 24.6% 향상되었다.
- 실제 데이터와 융합했을 때, RandPerson에서만 훈련한 모델의 성능은 순위 1 정확도에서 최대 13.4% 향상되었고, mAP는 12.7% 향상되어 상호 보완적 이점이 확인되었다.
- RandPerson의 장면 수와 신원 수가 증가할수록 성능이 점진적으로 향상되었지만, 일정 수의 장면 이후 포화 상태에 도달했고, 도메인 갭으로 인해 MSMT17에서 과적합 현상이 관찰되었다.
- 결과적으로, 다양한 다중 인물, 다중 카메라 감시 시뮬레이션을 포함한 합성 데이터는 도메인 이동을 효과적으로 줄이고 모델의 일반화 능력을 향상시킬 수 있음을 확인했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.