Skip to main content
QUICK REVIEW

[논문 리뷰] Motion Guided 3D Pose Estimation from Videos

Jingbo Wang, Sijie Yan|arXiv (Cornell University)|2020. 04. 29.
Human Pose and Action Recognition참고 문헌 43인용 수 10
한 줄 요약

이 논문은 2D 영상 시퀀스에서 단안 3D 인간 자세 추정을 위한 운동 손실 함수와 U형 그래프 컨볼루션 네트워크(UGCN)를 제안한다. 쌍별 운동 인코딩을 통해 관건점의 운동을 모델링함으로써 시간적 일관성과 정확도를 향상시켜, Human3.6M와 MPI-INF-3DHP에서 각각 25.6 mm MPJPE와 68.1 mm MPJPE로 최신 기준 성능을 달성한다.

ABSTRACT

We propose a new loss function, called motion loss, for the problem of monocular 3D Human pose estimation from 2D pose. In computing motion loss, a simple yet effective representation for keypoint motion, called pairwise motion encoding, is introduced. We design a new graph convolutional network architecture, U-shaped GCN (UGCN). It captures both short-term and long-term motion information to fully leverage the additional supervision from the motion loss. We experiment training UGCN with the motion loss on two large scale benchmarks: Human3.6M and MPI-INF-3DHP. Our model surpasses other state-of-the-art models by a large margin. It also demonstrates strong capacity in producing smooth 3D sequences and recovering keypoint motion.

연구 동기 및 목표

  • 표준 Minkowski 거리 손실이 3D 자세 추정 과정에서 시간적 운동 구조를 포착하는 데 한계가 있음을 해결하기 위해.
  • 명시적인 운동 동역학 모델링을 통해 예측된 3D 자세 시퀀스의 매끄럽고 자연스러운 성질을 향상시키기 위해.
  • 자세 시퀀스 내에서 단기 및 장기 시간적 의존성을 모두 포착할 수 있는 딥 러닝 아키텍처를 설계하기 위해.
  • 운동 기반의 감독이 표준 3D 위치 손실을 초월해 3D 자세 추정 정확도를 크게 향상시킬 수 있음을 입증하기 위해.
  • 2D 자세 입력을 사용한 영상 기반 3D 인간 자세 추정의 새로운 벤치마크를 설정하기 위해.

제안 방법

  • 다양한 시간 간격에서 2D/3D 관건점 위치 간의 쌍별 벡터(예: 뺄셈을 통한)를 연결함으로써 다중 척도 운동 역학을 포착하는 가분리 가능한 쌍별 운동 인코딩 표현을 사용해 예측된 관건점 운동 궤적과 진짜 운동 궤적의 유사도를 평가하는 새로운 운동 손실 함수를 도입한다.
  • 운동 인코딩을 정의하여, 다양한 시간 간격에서 2D/3D 관건점 위치 간의 쌍별 벡터(예: 뺄셈)를 연결함으로써 다중 척도 운동 역학을 포착한다.
  • U-Net을 영감으로 삼은 U-형 GCN(UGCN) 아키텍처를 제안하며, 이는 장거리 시간적 의존성을 모델링하면서도 3D 자세 시퀀스의 세밀한 운동 세부 정보를 유지하도록 설계되어 있다.
  • 표준 3D 관건점 회귀(ℓ2 손실)와 제안된 운동 손실을 조합한 다중 작업 손실을 사용하여 UGCN 모델을 훈련함으로써 시간적 일관성을 향상시킨다.
  • 최신 기술의 검출기(예: CPN, HR-Net)에서 생성한 2D 자세 시퀀스를 모델의 입력으로 사용하여 단안 영상에서 엔드 투 엔드 학습을 가능하게 한다.
  • 학습 가능한 가중치를 역전파를 통해 업데이트하는 가분리 가능한 운동 인코딩을 활용해, 뼈대 운동학을 모델링하기 위해 그래프 컨볼루션 네트워크를 사용한다.

실험 결과

연구 질문

  • RQ1새로운 손실 함수를 통한 명시적 운동 모델링이 단안 영상 추정에서 3D 자세 시퀀스의 시간적 일관성을 향상시킬 수 있는가?
  • RQ2표준 ℓ2/ℓ1 손실과 비교할 때 제안된 운동 손실은 3D 자세 정확도와 시퀀스의 매끄러움 측면에서 어떤가?
  • RQ3U-형 GCN 아키텍처가 3D 자세 시퀀스 내에서 단기 및 장기 운동 의존성을 효과적으로 포착할 수 있는가?
  • RQ4운동 기반 감독이 예측된 자세 시퀀스의 속도 오차를 얼마나 줄이고 자연스러운 운동을 향상시킬 수 있는가?
  • RQ5운동 손실과 UGCN의 조합이 기존 최신 기준 방법들을 초월하는 성능을 보일 수 있는가?

주요 결과

  • 지정된 2D 자세를 사용할 때, 제안된 방법은 Protocol 2 하에서 Human3.6M에서 25.6 mm MPJPE를 달성하여 이전의 모든 방법을 능가한다.
  • 운동 손실을 적용한 모델은 MPJVE를 32% 감소시켰다(3.4 mm에서 2.3 mm로), 이는 운동의 매끄러움이 크게 향상되었음을 시사한다.
  • MPI-INF-3DHP에서 모델은 86.9 PCK, 62.1 AUC, 68.1 mm MPJPE를 기록하여 새로운 최신 기준 성능을 수립했다.
  • 운동 손실은 복잡한 동작과 큰 움직임을 포함한 시각적 예측 결과를 통해 자세 시퀀스 품질 향상이 뚜렷하게 나타났다.
  • 운동 손실과 함께 사용된 UGCN 아키텍처는 특히 고속 및 복잡한 운동 시퀀스 처리에서 더 뛰어난 일반화 능력과 강건성을 보였다.
  • 제거 실험을 통해 운동 손실 자체만으로도 성능 향상이 가능하며, UGCN와의 조합이 모든 지표에서 최고의 성능을 달성함을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.