Skip to main content
QUICK REVIEW

[논문 리뷰] LiftFormer: 3D Human Pose Estimation using attention models

Adrian Llopart|arXiv (Cornell University)|2020. 09. 01.
Human Pose and Action Recognition참고 문헌 41인용 수 10
한 줄 요약

LiftFormer는 2D 키포인트 시퀀스에서 3D 인간 자세를 예측하기 위해 자기주의 주의 메커니즘을 활용하는 Transformer 인코더 기반 모델을 제안한다. 이는 더 나은 시간적 일관성을 확보하면서도 최신 기술 수준(SOTA) 성능을 달성한다. Human3.6M에서 2D 검출기 입력을 사용할 경우 MPJPE를 0.3 mm(44.8 mm) 감소시키고, 정답 입력을 사용할 경우 2 mm(31.9 mm) 감소시키며, 단지 9.5M 파라미터만을 사용함으로써 이전 방법들보다 적은 수의 파라미터로도 뛰어난 정확도와 효율성을 입증한다.

ABSTRACT

Estimating the 3D position of human joints has become a widely researched topic in the last years. Special emphasis has gone into defining novel methods that extrapolate 2-dimensional data (keypoints) into 3D, namely predicting the root-relative coordinates of joints associated to human skeletons. The latest research trends have proven that the Transformer Encoder blocks aggregate temporal information significantly better than previous approaches. Thus, we propose the usage of these models to obtain more accurate 3D predictions by leveraging temporal information using attention mechanisms on ordered sequences human poses in videos. Our method consistently outperforms the previous best results from the literature when using both 2D keypoint predictors by 0.3 mm (44.8 MPJPE, 0.7% improvement) and ground truth inputs by 2mm (MPJPE: 31.9, 8.4% improvement) on Human3.6M. It also achieves state-of-the-art performance on the HumanEva-I dataset with 10.5 P-MPJPE (22.2% reduction). The number of parameters in our model is easily tunable and is smaller (9.5M) than current methodologies (16.95M and 11.25M) whilst still having better performance. Thus, our 3D lifting model's accuracy exceeds that of other end-to-end or SMPL approaches and is comparable to many multi-view methods.

연구 동기 및 목표

  • 장기적인 시간적 의존성을 활용하여 단일 카메라 영상 시퀀스에서 3D 인간 자세 추정을 향상시키기.
  • 고정밀도 공간적 및 시간적 정확도로 2D 키포인트 예측을 3D 자세로 변환하는 과제 해결.
  • 성능과 파라미터 효율성 측면에서 기존 방법들을 능가하는 경량이지만 고정밀도 3D 리프팅 모델 개발.

제안 방법

  • 모델은 2D 키포인트 좌표 시퀀스를 입력으로 처리하는 Transformer 인코더 아키텍처를 사용한다.
  • 자기주의 주의 메커니즘을 통해 프레임 간 장기적인 시간적 관계를 포착하여 자세의 일관성을 향상시킨다.
  • 2D 입력으로부터 루트 기반 3D 관절 좌표를 예측하기 위해 엔드 투 엔드로 훈련된다.
  • 성능 손실가능성을 최소화하면서 모델 크기를 줄이기 위해 다중 헤드 주의 레이어 간 가중치 공유가 적용된다.
  • 수용성 범위, 인코더 블록 수, 은닉 차원 등 하이퍼파라미터를 조정하여 정확도와 효율성의 균형을 맞춘다.
  • 모델 스케일링이 유연하게 지원되어 소형 모델(예: 2.4M 파라미터)도 경쟁력 있는 성능을 낼 수 있다.

실험 결과

연구 질문

  • RQ1Transformer 인코더의 자기주의 주의 메커니즘이 2D 키포인트 시퀀스에서 3D 인간 자세 추정의 시간적 일관성 향상에 기여하는가?
  • RQ2기존의 RNN 및 CNN 기반 방법들과 비교해 표준 벤치마크에서 Transformer 기반 3D 리프팅 모델의 성능은 어떠한가?
  • RQ3가중치 공유 및 하이퍼파라미터 튜닝을 통해 정확도를 유지하면서 모델 크기를 얼마나 줄일 수 있는가?
  • RQ42D 검출기 출력과 정답 2D 키포인트 양측 모두를 사용할 때 제안된 방법이 최신 기술 수준의 결과를 달성하는가?
  • RQ5경량 Transformer 모델이 정확도와 파라미터 효율성 측면에서 더 큰 모델들을 능가할 수 있는가?

주요 결과

  • CPN 2D 예측을 사용할 경우 Human3.6M에서 LiftFormer는 44.8 mm MPJPE를 기록하며 이전 SOTA보다 0.3 mm(0.7%) 향상되었다.
  • 정답 2D 입력을 사용할 경우 LiftFormer는 31.9 mm MPJPE를 기록하여 이전 방법 대비 8.4% 향상되었다.
  • HumanEva-I 데이터셋에서 LiftFormer는 10.5 P-MPJPE를 기록하며 이전 방법 대비 22.2% 감소하였다.
  • 모델는 단지 9.5M 파라미터만을 사용하며, 경쟁 모델들(16.95M 및 11.25M)보다 작지만 더 뛰어난 성능을 달성했다.
  • 최소 2.4M 파라미터 버전조차도 더 큰 모델들(37.8 mm 대비 37.5 mm)보다 정확도와 파라미터 수에서 뛰어난 성능을 보였다.
  • 다중 헤드 주의에서의 가중치 공유로 파라미터 수가 크게 감소했고 성능 저하가 최소화되었으며, 특히 정답 입력에서 수용성 범위가 243인 경우 성능 향상까지 관찰되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.