Skip to main content
QUICK REVIEW

[논문 리뷰] Playing for 3D Human Recovery

Zhongang Cai, Mingyuan Zhang|arXiv (Cornell University)|2021. 10. 14.
Human Pose and Action Recognition참고 문헌 63인용 수 17
한 줄 요약

이 논문은 자동화된 게임 플레이 에이전트를 통해 Grand Theft Auto V를 플레이하면서 생성된 1.4백만 개의 3D 인간 시퀀스와 SMPL 파라미터를 포함하는 대규모 합성 데이터셋인 GTA-Human을 소개한다. 본 연구는 GTA-Human의 합성 데이터가 실제 데이터와 조합될 경우, 특히 자연스럽고 제약이 없는 환경에서 3D 인간 자세 및 형태 추정 성능을 크게 향상시킴을 입증한다.

ABSTRACT

Image- and video-based 3D human recovery (i.e., pose and shape estimation) have achieved substantial progress. However, due to the prohibitive cost of motion capture, existing datasets are often limited in scale and diversity. In this work, we obtain massive human sequences by playing the video game with automatically annotated 3D ground truths. Specifically, we contribute GTA-Human, a large-scale 3D human dataset generated with the GTA-V game engine, featuring a highly diverse set of subjects, actions, and scenarios. More importantly, we study the use of game-playing data and obtain five major insights. First, game-playing data is surprisingly effective. A simple frame-based baseline trained on GTA-Human outperforms more sophisticated methods by a large margin. For video-based methods, GTA-Human is even on par with the in-domain training set. Second, we discover that synthetic data provides critical complements to the real data that is typically collected indoor. Our investigation into domain gap provides explanations for our data mixture strategies that are simple yet useful. Third, the scale of the dataset matters. The performance boost is closely related to the additional data available. A systematic study reveals the model sensitivity to data density from multiple key aspects. Fourth, the effectiveness of GTA-Human is also attributed to the rich collection of strong supervision labels (SMPL parameters), which are otherwise expensive to acquire in real datasets. Fifth, the benefits of synthetic data extend to larger models such as deeper convolutional neural networks (CNNs) and Transformers, for which a significant impact is also observed. We hope our work could pave the way for scaling up 3D human recovery to the real world. Homepage: https://caizhongang.github.io/projects/GTA-Human/

연구 동기 및 목표

  • 3D 인간 복구를 위한 정확한 SMPL 애너테이션을 갖춘 3D 인간 데이터셋의 부족성과 높은 비용 문제를 해결하기 위해.
  • 기존 실세계 데이터셋의 한계를 극복하기 위해, 이는 종종 소규모이며 실내 전용이거나 파arametric한 3D 감시 정보가 부족하기 때문이다.
  • 합성된 게임 기반 데이터를 사용하여 3D 인간 추정 모델을 향상시키는 것의 가능성과 효과성을 탐색하기 위해.
  • 도메인 갭을 줄이고 일반화 능력을 향상시키기 위해 합성 데이터와 실세계 데이터를 조합하는 데이터 믹스 전략을 조사하기 위해.
  • 강력한 감시 정보(예: SMPL 파라미터)를 갖춘 대규모 합성 데이터가 복잡한 모델(예: Transformer)의 성능을 실데이터와 견줄 수 있거나 이를 초월할 수 있음을 입증하기 위해.

제안 방법

  • 다양한 가상 인간 시퀀스와 일관된 3D 인간 애너테이션을 수집하기 위해, 자율적으로 Grand Theft Auto V를 플레이하는 컴퓨팅 에이전트의 팀을 구동한다.
  • 게임 엔진의 내부 3D 데이터 파이프라인을 활용하여 각 가상 인간의 SMPL 파라미터(자세 및 형태)를 자동으로 추출한다.
  • 다양성을 극대화하기 위해 주제(600개 이상), 동작(20,000개), 장소(6개 카테고리), 카메라 각도, 조명, 날씨를 체계적으로 변화시킨다.
  • GTA-Human와 실세계 데이터셋(예: 3DPW, MPI-INF-3DHP)을 조합한 데이터 믹스 전략을 수립하여 학습 및 피니팅에 활용한다.
  • HMR, SPIN, VIBE, PARE 등의 다양한 모델을 혼합된 실세계-합성 데이터로 학습하고 평가하여 성능 향상을 분석한다.
  • 절단 실험을 통해 데이터 밀도, 감시 품질, 백본 아키텍처(CNN 및 Transformer)에 대한 모델 민감도를 분석한다.

실험 결과

연구 질문

  • RQ1합성된 게임 기반 데이터가 자연스럽고 제약이 없는(인간의 일상적인 환경) 설정에서 3D 인간 자세 및 형태 추정 성능을 크게 향상시킬 수 있는가?
  • RQ2실세계 데이터로 훈련된 고도로 복잡한 최신 기술 모델과 비교해 볼 때, 합성 데이터로 훈련된 단순한 프레임 기반 베이스라인의 효과성은 어떠한가?
  • RQ3합성 데이터와 실세계 데이터를 혼합함으로써 도메인 갭이 어느 정도 감소하고 다양한 환경에서의 일반화 능력이 향상되는가?
  • RQ4데이터 스케일과 밀도가 3D 인간 복구 작업의 모델 성능에 어떤 영향을 미치는가?
  • RQ5더 깊은 모델(예: Transformer)은 SMPL 파라미터와 같은 강력한 감시 정보를 갖춘 대규모 합성 데이터로부터 어떤 이점을 얻을 수 있는가?

주요 결과

  • GTA-Human로 훈련된 단순한 프레임 기반 베이스라인이, 3DPW와 같은 실세계 벤치마크에서 평가되었을 때, SPIN 및 VIBE와 같은 더 복잡한 최신 기술 모델보다 뛰어난 성능을 보였다.
  • 실세계 데이터와 합성 데이터를 혼합하여 훈련한 결과, 도메인 내 실세계 데이터로 훈련한 것과 동등한 성능을 달성하여 강력한 도메인 일반화 능력을 입증했다.
  • 모델 성능은 데이터 밀도에 매우 민감하다: 성능 향상은 특히 자연스러운 환경에서 추가 데이터의 양과 강하게 상관관계가 있다.
  • GTA-Human의 풍부한 SMPL 감시 정보—140만 개의 레이블링된 시퀀스—는 실세계 데이터셋과 비교해 볼 때 이러한 애너테이션이 매우 비용이 많이 들기 때문에 결정적인 이점이다.
  • 더 깊은 아키텍처인 Transformer 및 더 깊은 CNN도 GTA-Human로 사전 훈련할 경우 뚜렷한 성능 향상을 보이며, 합성 데이터의 이점이 확장 가능함을 확인했다.
  • 주제, 동작, 환경(실외 환경 포함)의 다양성이 있는 이 데이터셋은 모델이 실세계의 자연스러운 환경에 더 잘 일반화될 수 있도록 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.