Skip to main content
QUICK REVIEW

[논문 리뷰] P-STMO: Pre-Trained Spatial Temporal Many-to-One Model for 3D Human Pose Estimation

Wenkang Shan, Zhenhua Liu|arXiv (Cornell University)|2022. 03. 15.
Human Pose and Action Recognition인용 수 6
한 줄 요약

이 논문은 2D에서 3D로의 인간 자세 추정을 위한 사전 훈련된 공간-시간 다대일 모델인 P-STMO를 제안한다. 이 모델은 두 단계의 프레임워크를 사용한다: 공간-시간적 의존성을 포착하기 위해 자기지도 학습 기반의 마스킹된 자세 모델링 사전 훈련을 수행한 후, 다대일 프레임 집약기로 미세조정을 수행한다. 이 방법은 CPN에서 제공하는 2D 자세만을 사용하여 Human3.6M에서 42.1mm MPJPE를 달성하며, 이는 기존 방법 대비 1.5–7.1배의 계산 비용 절감을 이룬다.

ABSTRACT

This paper introduces a novel Pre-trained Spatial Temporal Many-to-One (P-STMO) model for 2D-to-3D human pose estimation task. To reduce the difficulty of capturing spatial and temporal information, we divide this task into two stages: pre-training (Stage I) and fine-tuning (Stage II). In Stage I, a self-supervised pre-training sub-task, termed masked pose modeling, is proposed. The human joints in the input sequence are randomly masked in both spatial and temporal domains. A general form of denoising auto-encoder is exploited to recover the original 2D poses and the encoder is capable of capturing spatial and temporal dependencies in this way. In Stage II, the pre-trained encoder is loaded to STMO model and fine-tuned. The encoder is followed by a many-to-one frame aggregator to predict the 3D pose in the current frame. Especially, an MLP block is utilized as the spatial feature extractor in STMO, which yields better performance than other methods. In addition, a temporal downsampling strategy is proposed to diminish data redundancy. Extensive experiments on two benchmarks show that our method outperforms state-of-the-art methods with fewer parameters and less computational overhead. For example, our P-STMO model achieves 42.1mm MPJPE on Human3.6M dataset when using 2D poses from CPN as inputs. Meanwhile, it brings a 1.5-7.1 times speedup to state-of-the-art methods. Code is available at https://github.com/paTRICK-swk/P-STMO.

연구 동기 및 목표

  • 깊이의 모호성으로 인해 2D에서 3D로의 자세 추정이 부족하게 정의되는 문제와 단일 단계 훈련 설정에서 공간-시간적 의존성을 학습하는 데 어려움이 있다는 점을 해결하기 위해.
  • 사전 훈련 후 미세조정을 통해 두 단계 훈련 파라다임을 도입함으로써 최적화의 어려움을 줄이고 일반화 성능을 향상시키기 위해.
  • 자연어 처리(NLP)와 컴퓨터 비전(CV)의 성공 사례를 영감으로 삼아, 3D 회귀 이전에 2D 자세 시퀀스의 강력한 표현을 학습하기 위해 자기지도 학습 기반 사전 훈련을 활용하기 위해.
  • 시간 축소 전략과 MLP 기반 공간 인코더를 도입하여 부서진 표현과 계산 오버헤드를 줄이고 효율성과 성능을 향상시키기 위해.
  • 노이즈가 있는 입력과 알려지지 않은 카메라 시야에서의 견고성과 일반화 능력을 검증하기 위해.

제안 방법

  • 두 단계의 프레임워크를 제안한다: 제1단계는 자기지도 학습 기반의 마스킹된 자세 모델링(MPM) 사전 훈련을 수행하며, 공간 및 시간 영역에서 랜덤으로 프레임과 관절을 마스킹한다.
  • MPM 작업은 원래의 2D 자세 시퀀스를 재구성하기 위해 노이즈 제거 오토인코더 목적함수를 사용하여 인코더가 내재된 공간-시간적 의존성을 학습할 수 있도록 한다.
  • 제2단계에서는 STMO 아키텍처 내에서 사전 훈련된 인코더를 미세조정한다. 이 아키텍처에는 공간 인코딩 모듈(SEM), 시간 인코딩 모듈(TEM), 다대일 프레임 집약기(MOFA)가 포함되어 있다.
  • SEM은 MLP 블록을 공간 특징 추출기로 사용하며, 이는 이 맥락에서 완전 연결층과 트랜스포머보다 우수한 성능를 보이며, 중간 수준의 계산 비용을 유지한다.
  • 시간 축소 전략(TDS)을 적용하여 데이터의 중복을 줄이고 모델 복잡도를 증가시키지 않으면서 시간적 수용장치를 확장한다.
  • MOFA 모듈은 트랜스포머 기반 아키텍처(Stepped Transformer Encoder, STE)를 사용하여 다수의 프레임에서 특징을 집약하고 현재 프레임의 3D 자세를 예측한다. 또한 다중 헤드 어텐션 맵을 시각화하여 기능 전문화를 확인한다.

실험 결과

연구 질문

  • RQ1마스킹된 2D 자세 시퀀스에 대한 자기지도 사전 훈련이 3D 인간 자세 추정 모델의 성능과 일반화 능력을 향상시킬 수 있는가?
  • RQ2사전 훈련 후 미세조정을 포함한 두 단계 훈련 전략이 2D에서 3D로의 자세 추정에서 최적화의 어려움을 줄이고 수렴을 향상시키는가?
  • RQ3MLP 기반 공간 인코더가 2D 자세 시퀀스의 내부 프레임 공간 관계를 포착하는 데에 완전 연결층이나 트랜스포머보다 우수한가?
  • RQ4제안된 시간 축소 전략은 중복을 줄이면서도 장거리 시간적 의존성을 유지하는 데 얼마나 효과적인가?
  • RQ5사전 훈련이 노이즈가 있는 2D 관절점 입력과 예상치 못한 카메라 시야와 같은 도메인 이동에 대해 얼마나 견고성을 향상시키는가?

주요 결과

  • P-STMO는 CPN에서 제공하는 2D 자세만을 사용하여 Human3.6M 데이터셋에서 42.1mm MPJPE를 달성하며, 파라미터 수가 적고 계산 오버헤드가 낮은 점에서 최신 기술 수준(SOTA)을 초월한다.
  • 기존 SOTA 방법 대비 1.5–7.1배의 속도 향상을 달성하여 뚜렷한 효율성 향상을 입증한다.
  • 사전 훈련은 견고성을 향상시킨다: 가우시안 노이즈(σ = 0.05) 조건에서 P-STMO는 사전 훈련되지 않은 기준 모델 대비 MPJPE를 2.0% 감소시킨다.
  • 모델은 알려지지 않은 카메라 시야로도 잘 일반화된다: 카메라 0,1,2에서 사전 훈련하고 카메라 3에서 테스트한 결과, 44.4mm MPJPE를 기록하여 사전 훈련되지 않은 변형(45.2mm)을 능가한다.
  • 어텐션 시각화 결과, 제2단계의 TEM이 국소적 패턴(예: 머리 0)과 전반적 패턴(예: 헤드 5)을 모두 학습하는 것을 확인할 수 있으며, MOFA는 현재 프레임과 그 이웃 프레임에 집중한다.
  • 입력 프레임의 무작위 재배열은 성능을 심각하게 떨어뜨리지만, 사전 훈련을 통해 이 성능 저하를 비사전 훈련 기준 대비 2.9% 감소시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.