Skip to main content
QUICK REVIEW

[논문 리뷰] 3D Human Pose Estimation using Spatio-Temporal Networks with Explicit Occlusion Training

Yu Cheng, Bo Yang|arXiv (Cornell University)|2020. 04. 07.
Human Pose and Action Recognition참고 문헌 39인용 수 14
한 줄 요약

이 논문은 단일 영상에서 강건한 3차원 인간 자세 추정을 위한 시공간 딥러닝 프레임워크를 제안한다. 다중 척도 공간 및 시간 특징을 통합하고, 자세 타당성을 위한 시공간 판별자, 그리고 관찰 차폐를 위한 키포인트 마스킹을 통한 명시적 관찰 차폐 증강 기법을 포함한다. 제안된 방법은 다양한 벤치마크에서 최신 기술 수준의 성능을 달성하였으며, Human 3.6M에서 MPJPE를 2.8mm(6.5%) 감소시켰고, 피팅 트레이닝 없이도 3DPW 및 MPI-INF-3DHP에서 기존 방법을 능가하였다.

ABSTRACT

Estimating 3D poses from a monocular video is still a challenging task, despite the significant progress that has been made in recent years. Generally, the performance of existing methods drops when the target person is too small/large, or the motion is too fast/slow relative to the scale and speed of the training data. Moreover, to our knowledge, many of these methods are not designed or trained under severe occlusion explicitly, making their performance on handling occlusion compromised. Addressing these problems, we introduce a spatio-temporal network for robust 3D human pose estimation. As humans in videos may appear in different scales and have various motion speeds, we apply multi-scale spatial features for 2D joints or keypoints prediction in each individual frame, and multi-stride temporal convolutional net-works (TCNs) to estimate 3D joints or keypoints. Furthermore, we design a spatio-temporal discriminator based on body structures as well as limb motions to assess whether the predicted pose forms a valid pose and a valid movement. During training, we explicitly mask out some keypoints to simulate various occlusion cases, from minor to severe occlusion, so that our network can learn better and becomes robust to various degrees of occlusion. As there are limited 3D ground-truth data, we further utilize 2D video data to inject a semi-supervised learning capability to our network. Experiments on public datasets validate the effectiveness of our method, and our ablation studies show the strengths of our networkś individual submodules.

연구 동기 및 목표

  • 다양한 운동 속도와 물체 크기를 가진 영상에서 3차원 인간 자세 추정 과제를 해결한다.
  • 특히 심각하거나 부분적인 관찰 차폐에 대한 강건성을 향상시키며, 기존 많은 방법들이 명시적으로 다루지 못하는 문제를 해결한다.
  • 공간 자세 구조와 시간적 운동 역학을 동시에 평가하는 시공간 판별자를 도입하여 자세 일관성과 해부학적 타당성을 향상시킨다.
  • 3D 참값이 제한된 상황에서 2D 영상 데이터를 활용해 일반화 성능을 향상시키기 위해 준지도 학습을 가능하게 한다.
  • 다양한 데이터셋, 특히 3DPW와 같이 다수의 사람과 실외 환경을 포함하는 데이터셋에서도 피팅 트레이닝 없이도 잘 작동하는 일반화 가능한 프레임워크를 설계한다.

제안 방법

  • 고해상도 히트맵을 생성하기 위해 다중 척도 공간 특징을 활용하는 HRNet을 사용하여 2D 키포인트 검출을 수행하고, 이를 잠재 공간에 인코딩하여 공간적 세부 정보를 유지한다.
  • 다양한 운동 속도에서 장거리 시간적 의존성을 포착하기 위해 잠재 특징에 다중 스트라이드 시간 컨volution 네트워크(TCN)를 적용한다.
  • 운동 동역학의 일관성과 자세 구조를 동시에 평가하기 위해 운동 사슬 공간(Kinematic Chain Space, KCS) 기반의 시공간 판별자를 도입한다.
  • 학습 중 2D 히트맵을 마스킹하여 명시적인 관찰 차폐 증강을 구현함으로써 관찰 차폐에 대한 강건성을 향상시킨다.
  • 3D 및 2D 데이터셋을 동시에 학습하여 3D 애너테이션이 부족한 영역에서 일반화 성능을 향상시키기 위해 준지도 학습을 구현한다.
  • 이중 브랜치 아키텍처를 사용하며, 하나는 2D 키포인트 추정을 위해, 다른 하나는 3D 자세 회귀를 위해 설계하고, 판별자가 적대적 정규화를 제공한다.

실험 결과

연구 질문

  • RQ1다중 척도 공간 및 시간 특징이 단일 영상에서 다양한 운동 속도와 물체 크기 조건에서 3차원 자세 추정의 강건성을 향상시키는가?
  • RQ2자세 구조와 운동 역학을 동시에 평가하는 시공간 판별자가 단일 프레임 판별자보다 더 해부학적으로 타당한 3차원 자세 시퀀스를 도출하는가?
  • RQ3학습 중 명시적인 관찰 차폐 증강이 실제 관찰 차폐 상황으로의 일반화 성능 향상에 어느 정도 기여하는가?
  • RQ4제안된 프레임워크가 피팅 트레이닝 없이도 도전적인 데이터셋인 3DPW 및 MPI-INF-3DHP에서 뛰어난 성능을 달성할 수 있는가?
  • RQ53D 참값이 제한된 상황에서 2D 영상 데이터를 활용한 준지도 학습 설정이 얼마나 효과적인가?

주요 결과

  • Human 3.6M 데이터셋에서 프로토콜 #1 하에서 MPJPE가 2.8mm(6.5% 상대 감소) 감소하여 뚜렷한 성능 향상을 보였다.
  • P-MPJPE는 2.1mm(6.4% 상대 감소) 감소하였으며, 사진 촬영 및 앉는 동작처럼 자주 관찰 차폐가 발생하는 동작에서 더 큰 향상이 관찰되었다.
  • 3DPW 데이터셋에서 피팅 트레이닝 없이도 P-MPJPE가 71.8을 기록하여 이전 방법의 보고된 값인 157.0과 80.1을 모두 능가하였다.
  • MPI-INF-3DHP에서 3D PCK가 1.6% 향상되었으며, 3DHP 데이터에 대해 재학습하지 않고도 Human 3.6M에서만 학습된 모델이 강력한 일반화 능력을 보였다.
  • 인간 운동 예측 과제에서, 3D 키포인트 참값이 없이 영상 입력만을 사용함에도 불구하고 최신 기술 수준의 접근법과 유사한 성능을 달성하였다.
  • 제거 실험 결과, 다중 척도 시간 특징과 시공간 KCS 판별자가 관찰 차폐 및 빠른 운동 처리에 있어 성능 향상에 크게 기여하는 것으로 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.