[논문 리뷰] PeopleSansPeople: A Synthetic Data Generator for Human-Centric Computer Vision
PeopleSansPeople는 인간 중심 컴퓨터 비전을 위한 합성 데이터 생성기로, 시뮬레이션용 3D 인간 자산, 동적 조명 및 카메라 설정, 2D/3D 바운딩 박스, 인스턴스 및 세그멘테이션 마스크, COCO 스타일의 키포인트 레이블을 포함한 풍부한 애너테이션을 생성한다. Detectron2 Keypoint R-CNN을 사전 훈련하는 데 사용되었을 때, 소수의 샘플로 전이할 경우 +38.03 AP 향상과, 전체 데이터 환경에서 +1.47 AP 향상을 기록하여, 실재 데이터만 사용하는 기준 모델과 ImageNet 사전 훈련 기준 모델을 모두 능가했다.
In recent years, person detection and human pose estimation have made great strides, helped by large-scale labeled datasets. However, these datasets had no guarantees or analysis of human activities, poses, or context diversity. Additionally, privacy, legal, safety, and ethical concerns may limit the ability to collect more human data. An emerging alternative to real-world data that alleviates some of these issues is synthetic data. However, creation of synthetic data generators is incredibly challenging and prevents researchers from exploring their usefulness. Therefore, we release a human-centric synthetic data generator PeopleSansPeople which contains simulation-ready 3D human assets, a parameterized lighting and camera system, and generates 2D and 3D bounding box, instance and semantic segmentation, and COCO pose labels. Using PeopleSansPeople, we performed benchmark synthetic data training using a Detectron2 Keypoint R-CNN variant [1]. We found that pre-training a network using synthetic data and fine-tuning on various sizes of real-world data resulted in a keypoint AP increase of $+38.03$ ($44.43 \pm 0.17$ vs. $6.40$) for few-shot transfer (limited subsets of COCO-person train [2]), and an increase of $+1.47$ ($63.47 \pm 0.19$ vs. $62.00$) for abundant real data regimes, outperforming models trained with the same real data alone. We also found that our models outperformed those pre-trained with ImageNet with a keypoint AP increase of $+22.53$ ($44.43 \pm 0.17$ vs. $21.90$) for few-shot transfer and $+1.07$ ($63.47 \pm 0.19$ vs. $62.40$) for abundant real data regimes. This freely-available data generator should enable a wide range of research into the emerging field of simulation to real transfer learning in the critical area of human-centric computer vision.
연구 동기 및 목표
- 실세계 인간 중심 데이터셋의 다양성 부족과 윤리적 문제를 해결하기 위해 확장 가능하고 개인정보 보호를 준수하는 합성 데이터 솔루션을 개발하기 위해.
- 대규모 실재 애너테이션 데이터에 의존하지 않고도 인간 중심 컴퓨터 비전에서 시뮬레이션에서 실세계로의 전이 학습을 가능하게 하기 위해.
- 연구자들이 합성 데이터를 이용해 키포인트 추정 및 인물 검출 분야에서 탐색할 수 있도록 완전히 접근 가능한, 시뮬레이션용 준비가 된 도구를 제공하기 위해.
- 인간 중심 작업을 위한 고해상도이면서 제어 가능한 합성 데이터 생성기를 구축하는 과제를 해결하기 위해.
제안 방법
- 프레임워크는 매개변수화된 3D 모델을 사용하여 다양한 자세, 체형, 의복을 가진 3D 인간 자산을 생성한다.
- 실제 장면 변화와 시야 조건을 시뮬레이션하기 위해 매개변수화된 조명 및 카메라 시스템을 적용한다.
- 시스템은 합성 이미지를 렌더링하고 자동으로 2D 및 3D 바운딩 박스, 인스턴스 및 세그멘테이션 마스크, COCO 스타일의 키포인트 애너테이션을 생성한다.
- 시뮬레이션용 배포를 위해 유니티와 통합하고 엔드 투 엔드 훈련 파이프라인을 지원한다.
- 합성 데이터는 Detectron2 기반의 Keypoint R-CNN 모델을 사전 훈련하는 데 사용되며, 이후 실세계 데이터로 미세조정된다.
- 파이프라인은 완전히 오픈소스이며, 코드, 템플릿, 벤치마크 바이너리가 모두 공개되어 있다.
실험 결과
연구 질문
- RQ1PeopleSansPeople로 생성된 합성 데이터가 사전 훈련에 사용되었을 때 인간 자세 추정에서 최신 기술 성능을 달성할 수 있는가?
- RQ2소수의 샘플과 대량의 실재 데이터 환경에서 합성 사전 훈련이 ImageNet 사전 훈련과 비교해 어떻게 성능을 내는가?
- RQ3합성 데이터의 자세, 조명, 카메라 설정의 다양성이 시뮬레이션에서 실세계로의 전이에서 일반화 성능을 얼마나 향상시키는가?
- RQ4합성 데이터 생성기가 대규모 실세계 인간 애너테이션에 대한 의존도를 줄이면서도 모델 성능을 유지하거나 향상시킬 수 있는가?
주요 결과
- PeopleSansPeople로 사전 훈련하고 제한된 COCO-person 훈련 데이터로 미세조정한 결과, 키포인트 검출 성능이 +38.03 AP 향상되었다 (44.43 ± 0.17 vs. 6.40).
- 전체 데이터 환경에서 합성 사전 훈련은 실재 데이터로만 훈련하는 것보다 AP를 +1.47 향상시켰다 (63.47 ± 0.19 vs. 62.00).
- PeopleSansPeople로 사전 훈련한 모델은 ImageNet 사전 훈련 모델보다 소수 샘플 전이에서 +22.53 AP 높은 성능을 보였다 (44.43 ± 0.17 vs. 21.90).
- 대규모 실재 데이터 설정에서도 PeopleSansPeople 사전 훈련은 ImageNet 사전 훈련보다 +1.07 AP 높은 성능을 기록했다 (63.47 ± 0.19 vs. 62.40).
- 합성 데이터 생성기는 최소한의 실세계 데이터로도 뛰어난 성능을 내어, 실세계 작업으로의 높은 전이 가능성을 입증했다.
- 생성기, 유니티 환경, 벤치마크 바이너리의 오픈소스 공개로 연구 공동체 내 재현 가능성 향상과 더 넓은 도입이 가능해졌다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.