[논문 리뷰] Live Stream Temporally Embedded 3D Human Body Pose and Shape Estimation
TePose는 과거 예측을 피드백으로 활용하여 시간적 일관성과 정확도를 향상시키는 실시간 스트리밍 영상용 시간적 임bedded 3D 인간 신체 자세 및 형태 추정 프레임워크를 제안한다. 다중 척도 시공간 그래프 컨볼루션 네트워크를 활용한 적대적 훈련과 순차적 데이터 로딩 전략을 통합함으로써, 장기 입력 시퀀스에 대한 의존도를 줄이고 안정성과 함께 최신 기술 수준의 성능을 달성한다.
3D Human body pose and shape estimation within a temporal sequence can be quite critical for understanding human behavior. Despite the significant progress in human pose estimation in the recent years, which are often based on single images or videos, human motion estimation on live stream videos is still a rarely-touched area considering its special requirements for real-time output and temporal consistency. To address this problem, we present a temporally embedded 3D human body pose and shape estimation (TePose) method to improve the accuracy and temporal consistency of pose estimation in live stream videos. TePose uses previous predictions as a bridge to feedback the error for better estimation in the current frame and to learn the correspondence between data frames and predictions in the history. A multi-scale spatio-temporal graph convolutional network is presented as the motion discriminator for adversarial training using datasets without any 3D labeling. We propose a sequential data loading strategy to meet the special start-to-end data processing requirement of live stream. We demonstrate the importance of each proposed module with extensive experiments. The results show the effectiveness of TePose on widely-used human pose benchmarks with state-of-the-art performance.
연구 동기 및 목표
- 실시간 스트리밍 영상에서 3D 인간 자세 및 형태 추정의 시간적 일관성 부족 문제를 해결하기 위해.
- 과거 예측을 시간 피드백의 다리로 활용하여 추정 정확도를 향상시키기 위해.
- 그래프 컨볼루션 네트워크 기반의 운동 디스criminator를 사용해 3D 지도 데이터 없이도 효과적인 훈련을 가능하게 하기 위해.
- 훈련 중에 진짜 메시 파라미터와 예측된 메시 파라미터를 혼합하는 순차적 데이터 로딩 전략을 설계하여, 이상적인 조건에서 시작함으로써 수렴을 촉진하기 위해.
- 이전 프레임의 임bedded 시간 정보를 활용함으로써 장기 입력 시퀀스에 대한 의존도를 줄이기 위해.
제안 방법
- TePose는 현재 영상 프레임과 이전 프레임의 예측된 SMPL 파라미터를 모두 입력으로 사용하여 현재 프레임의 추정을 수행하는 시간 임bedded 인코더를 사용한다.
- 다중 척도 시공간 그래프 컨볼루션 네트워크(GCN)는 실제 인간 운동 시퀀스와 생성된 시퀀스를 구분하는 운동 디스criminator로 기능하며, 3D 레이블 없이도 적대적 훈련을 가능하게 한다.
- 훈련 중에 진짜 메시 파라미터와 예측된 파라미터를 혼합하는 순차적 데이터 로딩 전략을 적용하여, 이상적인 조건에서 시작함으로써 수렴을 촉진한다.
- 모델은 정적 특징과 과거 예측의 시퀀스에서 장거리 의존성을 포착하기 위해 이중 방향 GRU 기반의 시간 인코더를 활용한다.
- 예측된 메시 파라미터를 감독하기 위해 SMPL 손실을 적용하고, GCN의 적대적 손실을 통해 운동 시퀀스의 현실감을 향상시킨다.
- 프레임워크는 MPI-INF-3DHP, Human3.6M, InstaVariety 등의 데이터셋에서 훈련되며, Mosh로부터 유도된 가짜-SMPL 레이블을 활용해 지도 학습을 수행한다.
실험 결과
연구 질문
- RQ1과거 자세 및 형태 예측은 실시간 스트리밍 영상에서 3D 인간 신체 추정의 시간적 일관성과 정확도를 향상시킬 수 있는가?
- RQ2그래프 컨볼루션 네트워크 기반의 운동 디스criminator는 3D 지도 없이도 적대적 훈련을 효과적으로 가능하게 하는가?
- RQ3진짜와 예측된 입력을 혼합하는 순차적 데이터 로딩 전략은 시간 임bedded 프레임워크에서 훈련의 안정성을 높일 수 있는가?
- RQ4기존의 영상 기반 모델 대비 제안된 방법은 얼마나 장기 입력 시퀀스에 대한 의존도를 줄일 수 있는가?
- RQ5현재 및 향후 프레임만을 사용하는 방법과 비교해 과거 예측에서 온 시간 피드백을 통합하는 방법은 어떠한가?
주요 결과
- TePose는 Human3.6M 테스트 세트에서 PA-MPJPE 41.2 mm를 기록하여 이전 최신 기술 수준의 방법들보다 정확도와 시간적 일관성 면에서 뛰어난 성능을 달성했다.
- 제거 실험을 통해 시간 임bedded 인코더, 순차적 데이터 로딩, 적대적 훈련 등 모든 제안된 모듈이 성능 향상에 기여한다는 것이 확인되었다.
- 프레임 기반 기준 대비 가속도 오차를 2.8% 감소시켜 시간적 안정성이 향상되었음을 입증했다.
- 단 6개의 입력 프레임으로도 16개 이상의 프레임을 필요로 하는 기존 방법들보다 더 뛰어난 성능를 기록하여 지연 시간과 계산 비용을 줄였다.
- 3DPW와 MPI-INF-3DHP에서의 정성적 비교 결과, VIBE와 TCMR에 비해 TePose는 더 안정적이고 정확한 자세 추정을 제공한다.
- 3D 지도 데이터가 없는 실외 데이터에서도 GCN 기반 디스criminator를 활용한 적대적 훈련이 운동의 현실감을 향상시켰다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.