Skip to main content
QUICK REVIEW

[논문 리뷰] 3D human pose estimation in video with temporal convolutions and semi-supervised training

Dario Pavllo, Christoph Feichtenhofer|arXiv (Cornell University)|2018. 11. 28.
Human Pose and Action Recognition인용 수 4
한 줄 요약

이 논문은 2D 키포인트 트레이젝터리에 대해 확장된 시간 컨볼루션을 사용하는 완전 컨volutional 3D 인간 자세 추정 모델을 제안하며, 이전 작업 대비 Human3.6M에서 평균 관절 위치 오차(MPJPE)를 6 mm 감소시켜 상대적 개선률 11%를 달성한다. 또한, 레이블이 없는 영상을 활용해 3D 자세를 예측하고 2D로 역투영하는 역투영(back-projection)이라는 준지도 학습 방법을 도입하여, 레이블 데이터가 부족할 경우 오차를 최대 14.7 mm 감소시킨다.

ABSTRACT

In this work, we demonstrate that 3D poses in video can be effectively estimated with a fully convolutional model based on dilated temporal convolutions over 2D keypoints. We also introduce back-projection, a simple and effective semi-supervised training method that leverages unlabeled video data. We start with predicted 2D keypoints for unlabeled video, then estimate 3D poses and finally back-project to the input 2D keypoints. In the supervised setting, our fully-convolutional model outperforms the previous best result from the literature by 6 mm mean per-joint position error on Human3.6M, corresponding to an error reduction of 11%, and the model also shows significant improvements on HumanEva-I. Moreover, experiments with back-projection show that it comfortably outperforms previous state-of-the-art results in semi-supervised settings where labeled data is scarce. Code and models are available at https://github.com/facebookresearch/VideoPose3D

연구 동기 및 목표

  • 재귀 모델보다 더 효과적으로 시간적 맥락을 활용하여 비디오 내 3D 인간 자세 추정을 향상시키기 위해.
  • 레이블이 부여된 3D 자세 데이터의 부족 문제를 해결하기 위해, 2D 진짜값이나 다중 시점 데이터가 필요 없이 레이블이 없는 영상을 활용하는 준지도 학습 방법을 도입하기 위해.
  • 정확성과 효율성을 동시에 확보하여, RNN 기반 접근 방식에 비해 병렬 처리가 가능하고 계산 복잡도가 낮은 모델을 개발하기 위해.
  • 레이블이 제한된 상황에서 효과적으로 일반화를 향상시키는 데에 역투영, 즉 사이클 일致성 기반 방법이 실제로 효과적인지 입증하기 위해.

제안 방법

  • 2D 키포인트 트레이잭터리의 장거리 의존성을 모델링하기 위해 확장된 시간 컨볼루션을 사용하는 완전 컨볼루션 아키텍처를 사용한다.
  • 확장된 컨볼루션을 적용하여 낮은 계산 비용으로 넓은 수신장(Receptive Field)을 확보함으로써 장기간 시퀀스의 효율적 모델링을 가능하게 한다.
  • 역투영을 도입: 2D 키포인트에서 3D 자세를 예측하고 이를 다시 2D로 투영하여 일致성 손실를 형성하는 준지도 학습 방식이다.
  • 운동역학 일치성을 강제하고 역투영 과정에서 자세의 타당성을 향상시키기 위해 뼈 길이 정규화 항을 통합한다.
  • 레이블이 있는 데이터에 대한 지도 학습 손실과 레이블이 없는 영상에서의 역투영을 통한 일치성 손실을 조합하여 모델을 훈련시킨다.
  • 역투영 단계에서 외부 카메라 매개변수나 2D 진짜값이 필요 없도록, 카메라 내부 매개변수만을 사용한다.

실험 결과

연구 질문

  • RQ1확장된 시간 컨볼루션을 사용하는 완전 컨볼루션 모델이 RNN 기반 모델보다 비디오 내 3D 인간 자세 추정에서 더 우수한 성능을 내는가?
  • RQ2사이클 일치성 기반 준지도 학습 방법인 역투영이 레이블 데이터가 제한된 상황에서 3D 자세 추정 성능을 실제로 향상시키는가?
  • RQ3특히 자원이 제한된 환경에서 레이블 데이터의 양이 감소함에 따라 제안된 방법의 성능가 어떻게 변화하는가?
  • RQ4뼈 길이 정규화를 통한 운동역학 제약 강제가 준지도 학습에서 일반화 능력을 얼마나 향상시키는가?

주요 결과

  • 제안된 완전 컨볼루션 모델은 Human3.6M 데이터셋에서 평균 관절 위치 오차(MPJPE)를 53.1 mm에서 47.1 mm로 6 mm 감소시켜 이전 최고 성능 대비 상대적 개선률 11%를 달성한다.
  • HumanEva-I에서 이전 방법보다 우수한 성능을 보이며, Human3.6M 벤치마크를 초월한 일반화 능력을 입증한다.
  • 레이블이 5,000장 이하인 준지도 학습 환경에서, 역투영 방법은 강력한 지도 학습 기반선 대비 최대 14.7 mm MPJPE 감소를 달성한다.
  • 진짜 2D 키포인트를 사용해 훈련한 경우, 1%의 S1 데이터에서 준지도 학습 방법이 지도 학습 기반선 대비 최대 22.6 mm MPJPE 향상을 달성하며, 더 나은 2D 키포인트 검출기의 잠재력을 입증한다.
  • 역투영 과정에서 뼈 길이 정규화 항을 제거할 경우, S1의 1%에서 오차가 78.1 mm에서 91.3 mm로 증가하여, 이 항이 자세 타당성을 유지하는 데 핵심적인 역할을 한다는 것을 입증한다.
  • 단일 GPU에서 모델은 약 150k FPS의 추론 속도를 기록하며, 병렬 시간 처리 덕분에 배치 크기와 관계없이 속도가 유지되어 RNN 기반 모델에 비해 효율성이 뛰어나다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.