Skip to main content
QUICK REVIEW

[논문 리뷰] Monocular 3D Human Pose Estimation Using Transfer Learning and Improved CNN Supervision

Dushyant Mehta, Helge Rhodin|arXiv (Cornell University)|2016. 11. 29.
Human Pose and Action Recognition인용 수 34
한 줄 요약

이 논문은 뼈대 운동학적 관계와 다중 수준 스킵 연결을 통해 향상된 CNN 감독을 활용하고, 2D 자세 모델에서의 전이 학습을 결합한 새로운 CNN 기반 단안 3D 인간 자세 추정 방법을 제안한다. 이로 인해 표준 벤치마크에서 25% 이상의 성능 향상을 달성한다. 또한 실제 세계 일반화를 위해 마커리스 모션 캡처 기반의 새로운 다양하고 다채로운 벤치마크를 도입한다.

ABSTRACT

We propose a new CNN-based method for regressing 3D human body pose from a single image that improves over the state-of-the-art on standard benchmarks by more than 25%. Our approach addresses the limited generalizability of models trained solely on the starkly limited publicly available 3D body pose data. Improved CNN supervision leverages first and second order parent relationships along the skeletal kinematic tree, and improved multi-level skip connections to learn better representations through implicit modification of the loss landscape. Further, transfer learning from 2D human pose prediction significantly improves accuracy and generalizability to unseen poses and camera views. Additionally, we contribute a new benchmark and training set for human body pose estimation from monocular images of real humans, that has ground truth captured with marker-less motion capture. It complements existing corpora with greater diversity in pose, human appearance, clothing, occlusion, and viewpoints, and enables increased scope of augmentation. The benchmark covers outdoors and indoor scenes.

연구 동기 및 목표

  • 공개된 3D 자세 데이터가 극히 부족한 상황에서 훈련된 3D 인간 자세 모델의 일반화 능력이 제한되어 있는 문제를 해결하기 위해.
  • 뼈대 운동학적 관계를 활용한 향상된 CNN 감독을 통해 특징 표현 학습을 향상시키기 위해.
  • 2D 자세 예측 모델에서의 전이 학습을 통해 예측할 수 없는 자세와 카메라 시점에 대한 모델 일반화 능력을 향상시키기 위해.
  • 단안 3D 자세 추정을 위한 실세계 변형(자세, 외관, 옷, 가림, 시점 등)을 포함한 새로운 다양하고 다채로운 벤치마크를 구축하기 위해.
  • 마커리스 모션 캡처된 진짜 값(ground truth)을 활용해 더 넓은 데이터 증강과 더 강력한 평가를 지원하기 위해.

제안 방법

  • 뼈대 운동학적 트리의 첫 번째 및 두 번째 순서 부모 관계를 활용하여 CNN 감독을 향상시킨다.
  • 개선된 다중 수준 스킵 연결을 사용하여 손실 곡면을 수정하고 더 나은 계층적 표현을 학습한다.
  • 사전 훈련된 2D 인간 자세 추정 네트워크의 가중치로 모델을 초기화함으로써 전이 학습을 적용한다.
  • 향상된 감독 신호를 사용하여 3D 관절 좌표에 대한 회귀 손실을 통해 네트워크를 엔드 투 엔드로 훈련시킨다.
  • 마커리스 모션 캡처를 사용하여 다양한 실세계 단안 영상 시퀀스와 3D 진짜 값을 포함하는 새로운 벤치마크를 구축한다.
  • 훈련 데이터에는 다양한 자세, 인간의 외형, 옷, 가림, 실내/실외 환경이 포함되어 있어 강건성을 확보한다.

실험 결과

연구 질문

  • RQ1뼈대 운동학적 관계를 통한 향상된 CNN 감독은 3D 자세 추정 정확도를 어떻게 향상시킬 수 있는가?
  • RQ22D 자세 모델에서의 전이 학습은 예측할 수 없는 자세와 카메라 시점에 대한 일반화 능력을 얼마나 향상시킬 수 있는가?
  • RQ3다중 수준 스킵 연결은 3D 자세 회귀에서 특징 학습을 향상시키기 위해 손실 곡면을 효과적으로 수정할 수 있는가?
  • RQ4마커리스 모션 캡처 데이터를 활용한 다양하고 실세계적인 벤치마크는 모델 성능과 평가에 어떤 영향을 미치는가?
  • RQ5제안된 방법은 표준 벤치마크에서 최신 기술(SOTA) 대비 얼마나 높은 성능 향상을 달성하는가?

주요 결과

  • 제안된 방법은 최신 기술(SOTA) 대비 표준 벤치마크에서 25% 이상의 성능 향상을 달성한다.
  • 첫 번째 및 두 번째 순서 부모 감독을 통한 뼈대 운동학적 관계 통합은 모델 정확도를 향상시킨다.
  • 2D 자세 예측에서의 전이 학습은 예측할 수 없는 자세와 카메라 시점에 대한 일반화 능력을 크게 향상시킨다.
  • 개선된 다중 수준 스킵 연결은 손실 곡면을 암묵적으로 수정함으로써 더 나은 특징 표현 학습을 이끈다.
  • 마커리스 모션 캡처된 데이터를 활용한 새로운 벤치마크는 더 다양한 실재적인 훈련과 평가를 가능하게 하며, 더 넓은 증강과 일반화를 지원한다.
  • 이 방법은 가림, 다양한 옷, 복잡한 시점 등 다양한 실세계 조건에서도 강건한 성능을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.