[논문 리뷰] WHAM: Reconstructing World-grounded Humans with Accurate 3D Motion
WHAM은 SLAM에서의 카메라 각속도, 2D 키포인트 시퀀스, 영상 특징, 접촉 인식 트레이젝터리 정련을 조합하여 단일 영상에서 실시간으로 정확한 글로벌 좌표계 기반 3D 인간 운동을 복원하는 방법을 제안한다. 이는 발슬라이딩 없이도 3D 자세 추정과 글로벌 트레이젝터리 복원에서 높은 정확도를 달성하여, 자연계 벤치마크에서 최신 기술을 초월한다.
The estimation of 3D human motion from video has progressed rapidly but current methods still have several key limitations. First, most methods estimate the human in camera coordinates. Second, prior work on estimating humans in global coordinates often assumes a flat ground plane and produces foot sliding. Third, the most accurate methods rely on computationally expensive optimization pipelines, limiting their use to offline applications. Finally, existing video-based methods are surprisingly less accurate than single-frame methods. We address these limitations with WHAM (World-grounded Humans with Accurate Motion), which accurately and efficiently reconstructs 3D human motion in a global coordinate system from video. WHAM learns to lift 2D keypoint sequences to 3D using motion capture data and fuses this with video features, integrating motion context and visual information. WHAM exploits camera angular velocity estimated from a SLAM method together with human motion to estimate the body's global trajectory. We combine this with a contact-aware trajectory refinement method that lets WHAM capture human motion in diverse conditions, such as climbing stairs. WHAM outperforms all existing 3D human motion recovery methods across multiple in-the-wild benchmarks. Code will be available for research purposes at http://wham.is.tue.mpg.de/
연구 동기 및 목표
- 기존 3D 인간 운동 추정 방법의 한계를 해결하기 위해, 카메라 좌표계에서 작동하는 경우가 많고 발슬라이딩이나 높은 계산 비용 문제를 야기한다는 점을 해결한다.
- 임의의 카메라 운동을 가진 단일 영상에서 정확하고 효율적이며 글로벌 일관성을 확보한 3D 인간 운동 복원을 가능하게 한다.
- 영상과 운동 캡처 데이터의 시간적 맥락을 활용하여 단일 프레임 방법을 초월한 정확도 향상을 도모한다.
- 접촉 인식 트레이젝터리 정련을 통해 글로벌 트레이젝터리에서의 발슬라이딩을 제거한다.
- 빠르고 종단 간(end-to-end) 학습 기반 파이프라인을 통해 AR/VR, 로봇공학, 자율 시스템과 같은 실시간 응용을 지원한다.
제안 방법
- WHAM은 장기적인 운동 맥락을 포착하기 위해 AMASS 데이터셋에서 운동 인코더와 디코더를 사전 학습하여 2D 키포인트 시퀀스를 3D SMPL 파라미터로 업컨버트한다.
- 2D 키포인트 시퀀스와 시간에 걸친 영상 특징을 융합하여 자세 및 형태 추정 정확도를 향상시키기 위해 특징 통합 네트워크를 도입한다.
- SLAM 또는 자이로스코프 데이터에서 제공하는 카메라 각속도와 예측된 운동 맥락을 조합하여 글로벌 인간 트레이젝터리를 추정한다.
- 운동 맥락과 카메라 각속도를 사용하여 인간 자세 및 루트 속도를 순차적으로 예측하는 글로벌 트레이젝터리 디코더를 설계하여 글로벌 좌표 추정을 가능하게 한다.
- 실제 발-지면 접촉을 강제하고 고도 변화 중 발슬라이딩을 줄이기 위해 접촉 인식 트레이젝터리 정련을 적용한다.
- 3D 진짜값이 있는 영상 데이터셋을 사용하여 종단 간 엔드 투 엔드로 학습하며, 데이터 합성 시 무작위 마스킹을 활용하여 강인성을 향상시킨다.

실험 결과
연구 질문
- RQ1비용이 많이 드는 최적화에 의존하지 않고도 학습 기반 방법이 단일 영상에서 글로벌 좌표계 기반 정확한 3D 인간 운동 추정을 달성할 수 있는가?
- RQ22D 키포인트에서 유도된 운동 맥락을 조밀한 시각적 특징과 효과적으로 융합하여 3D 자세 및 형태 추정 정확도를 향상시킬 수 있는가?
- RQ3SLAM 또는 자이로스코프에서 제공하는 카메라 각속도를 활용하여 인간 운동과 카메라 운동을 분리하여 정확한 글로벌 트레이젝터리 추정이 가능한가?
- RQ4복잡한 운동(예: 계단 오르내림) 중 접촉 인식 정련이 발슬라이딩을 상당히 줄일 수 있는가?
- RQ5모션 캡처 데이터로 학습된 방법이 자연계 영상으로 일반화되면서도 높은 정확도와 실시간 성능를 유지할 수 있는가?
주요 결과
- WHAM은 여러 자연계 벤치마크에서 최신 기술을 초월하는 성능을 달성하여 3D 자세 추정과 글로벌 트레이젝터리 정확도 모두에서 뛰어난 결과를 보였다.
- 절단 실험 결과, 특징 통합이 기준 모델 대비 루트 이동 오차를 14.8% 감소시키고 발 속도 오차를 19.8% 감소시켰다.
- AMASS에서의 사전 학습을 제거하면 성능에 심각한 하락이 발생하여 운동 맥락 학습의 중요성을 입증했다.
- 트레이젝터리 정련 모듈은 정련이 없는 버전 대비 루트 이동 오차를 8.8% 감소시키고 발 속도 오차를 14.8% 감소시켰다.
- 카메라 각속도 사용은 필수적이다: 이를 제거하면 루트 이동 오차가 20.8% 증가하고 회전 오차가 19.8% 증가하여 인간 운동과 카메라 운동의 혼동이 있음을 시사한다.
- WHAM은 3D H3.6M 벤치마크에서 41.9%의 오차율을 기록하여 이전 방법들을 크게 능가하며, 실시간 추론 속도를 유지했다.
![Figure 3 : WHAM’s Two-Stage Training Scheme. During pre-taining, we generate synthetic 2D keypoint sequences from AMASS [ 32 ] and train a motion encoder and decoder on the generated data ( top ). We then leverage video datasets with ground truth SMPL parameters, for which there is much less data. W](https://ar5iv.labs.arxiv.org/html/2312.07531/assets/x3.png)
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.