[논문 리뷰] MPT: Mesh Pre-Training with Transformers for Human Pose and Mesh Reconstruction
이 논문은 대규모 MoCap 데이터를 사용하여 3D 인간 자세 및 메시 재구성에 대한 자기지도 사전 훈련 방법인 메시 사전 훈련(MPT)을 제안한다. MoCap로 생성된 히트맵과 새로운 마스크된 히트맵 모델링(MHM) 목적함수를 활용함으로써, MPT는 페어드 이미지-메시 데이터가 사전 훈련 중에 필요 없이 강력한 제로샷 추론과 Human3.6M, 3DPW, FreiHAND에서 최고 성능을 달성한다.
Traditional methods of reconstructing 3D human pose and mesh from single images rely on paired image-mesh datasets, which can be difficult and expensive to obtain. Due to this limitation, model scalability is constrained as well as reconstruction performance. Towards addressing the challenge, we introduce Mesh Pre-Training (MPT), an effective pre-training strategy that leverages large amounts of MoCap data to effectively perform pre-training at scale. We introduce the use of MoCap-generated heatmaps as input representations to the mesh regression transformer and propose a Masked Heatmap Modeling approach for improving pre-training performance. This study demonstrates that pre-training using the proposed MPT allows our models to perform effective inference without requiring fine-tuning. We further show that fine-tuning the pre-trained MPT model considerably improves the accuracy of human mesh reconstruction from single images. Experimental results show that MPT outperforms previous state-of-the-art methods on Human3.6M and 3DPW datasets. As a further application, we benchmark and study MPT on the task of 3D hand reconstruction, showing that our generic pre-training scheme generalizes well to hand pose estimation and achieves promising reconstruction performance.
연구 동기 및 목표
- 3D 인간 메시 재구성에 필요한 페어드 이미지-메시 데이터셋의 부족성과 높은 비용 문제를 해결하기 위해.
- 이미지 감독 없이 대규모 MoCap 데이터를 활용하여 모델의 확장성과 성능을 향상시키기 위해.
- 손, 몸통 등 다양한 신체 부위에 일반화 가능한 사전 훈련 프레임워크를 개발하기 위해.
- 사전 훈련된 일반화 가능한 인간 자세 및 형태 표현을 통해 피지컬 테이닝 없이도 효과적인 추론을 가능하게 하기 위해.
제안 방법
- 가상 카메라 투영을 통해 3D 메시 데이터에서 생성된 MoCap 히트맵을 사용하여 메시 회귀 트랜스포머를 사전 훈련한다.
- 히트맵 입력에 대한 자기지도 표현 학습을 향상시키기 위해, 마스크된 히트맵 모델링(MHM)이라는 마스크된 오토인코딩 목적함수를 도입한다.
- 추론 중에 입력 이미지에서 특징 맵을 추출하기 위해 표준 2D 자세 모델(예: HigherHRNet)을 사용한다.
- 단일 이미지 재구성에 맞게 사전 훈련된 특징을 적응시키기 위해 2D-3D 감독을 사용하여 전체 파ipeline를 엔드 투 엔드로 미세조정한다.
- 200만 개의 인간 메시를 활용하여 사전 훈련을 확장하여 풍부하고 일반화 가능한 인간 신체 사전 지식을 학습한다.
- 합성 MoCap 데이터(Complement)를 사용하여 3D 손 재구성에 동일한 사전 훈련 방식을 적용함으로써 일반화 능력을 입증한다.
실험 결과
연구 질문
- RQ1페어드 이미지가 없는 3D 인간 메시 재구성에서 MoCap 데이터를 자기지도 사전 훈련에 효과적으로 활용할 수 있는가?
- RQ2직접 3D 관절 회귀보다 MoCap로 생성된 히트맵을 입력 표현으로 사용할 경우 사전 훈련 성능이 향상되는가?
- RQ3사전 훈련된 모델이 미세조정 없이도 실제 이미지에서 제로샷 추론에 일반화 가능한가?
- RQ4MoCap 데이터의 크기가 사전 훈련 성능에 어떤 영향을 미치는가?
- RQ5제안된 MPT 프레임워크가 최소한의 적응으로 손과 같은 다른 신체 부위로 일반화될 수 있는가?
주요 결과
- MPT는 Human3.6M에서 PA-MPJPE 5.4 mm와 PA-MPJPE 5.6 mm를 기록하여 이전 방법들을 능가하는 최고 성능을 달성한다.
- 3DPW 데이터셋에서 MPT는 PA-MPJPE 5.6 mm를 기록하여 제약 없는 이미지에 대한 강력한 일반화 능력을 입증한다.
- FreiHAND 데이터셋에서 MPT는 PA-MPJPE 5.6 mm와 F@15 mm 0.988을 기록하여 이전 최고 성능 방법들을 초월한다.
- 절단 실험 결과, MHM는 PA-MPJPE를 크게 향상시켜 자기지도 학습에서의 효과성을 확인한다.
- 증가하는 데이터 스케일로 사전 훈련을 수행할수록 제로샷 성능이 향상되며, 100% 데이터로 사전 훈련 시 미세조정 없이도 Human3.6M에서 58.4 PA-MPJPE를 기록한다.
- 이 방법은 손 재구성으로도 잘 일반화되며, 단지 합성 MoCap 데이터만을 사용하여 사전 훈련한 상태에서 FreiHAND에서 최고 성능을 기록한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.