Skip to main content
QUICK REVIEW

[논문 리뷰] Monocular 3D Human Pose Estimation In The Wild Using Improved CNN Supervision

Dushyant Mehta, Helge Rhodin|arXiv (Cornell University)|2016. 11. 29.
Human Pose and Action Recognition참고 문헌 74인용 수 16
한 줄 요약

이 논문은 마커리스 모션 캡처 시스템으로 촬영한 새로운 인라인 와일드 3D 자세 데이터셋인 MPI-INF-3DHP를 활용하여 단안 3D 인간 자세 추정을 위한 CNN 기반 방법을 제안한다. 2D 자세 데이터셋에서의 전이 학습을 활용하고, 개선된 CNN 감독, 도메인 적응, 데이터 증강을 조합함으로써 기준 테스트 베이스에서 최신 기술 수준의 성능을 달성하며, 제약이 없는 실제 환경으로의 일반화 능력을 크게 향상시킨다.

ABSTRACT

We propose a CNN-based approach for 3D human body pose estimation from single RGB images that addresses the issue of limited generalizability of models trained solely on the starkly limited publicly available 3D pose data. Using only the existing 3D pose data and 2D pose data, we show state-of-the-art performance on established benchmarks through transfer of learned features, while also generalizing to in-the-wild scenes. We further introduce a new training set for human body pose estimation from monocular images of real humans that has the ground truth captured with a multi-camera marker-less motion capture system. It complements existing corpora with greater diversity in pose, human appearance, clothing, occlusion, and viewpoints, and enables an increased scope of augmentation. We also contribute a new benchmark that covers outdoor and indoor scenes, and demonstrate that our 3D pose dataset shows better in-the-wild performance than existing annotated data, which is further improved in conjunction with transfer learning from 2D pose data. All in all, we argue that the use of transfer learning of representations in tandem with algorithmic and data contributions is crucial for general 3D body pose estimation.

연구 동기 및 목표

  • 희귀하고 제어된 3D 자세 데이터셋에만 훈련된 3D 자세 추정 모델의 일반화 능력이 제한됨을 해결한다.
  • 자세의 다양성, 가림 현상, 다양한 외형 등으로 인해 기존 방법이 도전받는 제약이 없는 실제 환경에서의 성능을 향상시킨다.
  • 실제 환경의 장면에 대해 대규모, 다양한, 현실적인 3D 자세 주석이 부족한 문제를 해결하기 위해 마커리스 다중 카메라 시스템으로 촬영한 새로운 데이터셋을 도입한다.
  • 2D 자세 추정 특징에서의 전이 학습이 실제 환경에서 3D 자세 추정 정확도와 강인성에 크게 기여함을 입증한다.
  • 추가 3D 주석이 필요 없이 아키텍처 개선, 데이터 증강, 다중 모odal 감독을 조합하여 모델의 일반화 능력을 향상시키는 방법을 개발한다.

제안 방법

  • 2D 자세 추정 네트워크에서 미리 훈련된 특징을 사용하여 3D 자세 네트워크를 초기화하고, 도메인 적응을 통해 도메인 간 특징를 정렬함으로써 전이 학습을 수행한다.
  • 3D 관절 위치, 루트 방향, 부위 레이블 예측 헤드를 사용하여 다중 레이어(예: res4b5 및 res4b20)에서 중간 감독을 구현한다.
  • 최종 합성곱 레이어(res5a)에서 2D 히트맵 및 부위 레이블 맵 예측을 통해 보조 감독을 적용하여 특징 학습을 향상시킨다.
  • Human3.6m와 MPI-INF-3DHP 데이터셋을 결합한 다중 모달 융합 전략을 도입하고, 공동 훈련을 위해 각각 별도의 학습률 스케일링 및 손실 가중치 스케줄링을 적용한다.
  • 2D 데이터(예: MPII, LSP)에서의 인라인 와일드 데이터와 3D 자세 네트워크의 특징를 정렬하기 위해 기울기 반전 모듈을 활용한 도메인 적응 모듈을 도입하여 도메인 이동에 대한 강인성을 향상시킨다.
  • MPI-INF-3DHP 데이터셋의 전경 및 배경 다양성을 향상시키기 위해 배경, 의자, 텍스처 변화를 포함한 광범위한 데이터 증강을 적용한다.

실험 결과

연구 질문

  • RQ12D 자세 추정 네트워크에서의 전이 학습이 제약이 없는 실제 환경에서의 3D 자세 추정 일반화 능력을 향상시키는가?
  • RQ2제안된 데이터 증강 및 다중 모달 훈련 전략이 실제 시퀀스에서 모델의 강인성과 성능에 어떤 영향을 미치는가?
  • RQ3마커리스 시스템으로 촬영한 새로운 인라인 와일드 3D 자세 데이터셋이 기존 데이터셋에 비해 모델의 일반화 능력을 얼마나 향상시키는가?
  • RQ4CNN 아키텍처 내 중간 감독 및 보조 작업이 3D 자세 추정 정확도와 특징 학습을 향상시키는가?
  • RQ5아키텍처 개선, 데이터 다양성, 전이 학습의 조합이 단순한 초기화 또는 도메인 적응만을 사용하는 것보다 우수한 성능을 내는가?

주요 결과

  • 전이 학습을 사용하여 MPI-INF-3DHP 테스트 세트에서 64.7 3DPCK를 달성하였으며, 도메인 적응만을 사용한 경우(41.4 3DPCK)보다 유의미하게 높은 성능을 보였다.
  • 새로운 MPI-INF-3DHP 데이터셋은 기존 기준 베이스에서 최신 기술 수준의 성능을 달성하였고, 기존 데이터셋에 비해 실제 환경으로의 일반화 능력이 뛰어나다는 것을 입증하였다.
  • 적절한 미세조정을 통해 2D 자세 추정 네트워크에서의 전이 학습은 단순한 가중치 초기화나 도메인 적응 기반 접근보다 더 높은 정확도와 일반화 능력을 제공한다.
  • 다중 모달 훈련(Human3.6m + MPI-INF-3DHP)과 개선된 데이터 증강의 조합이 모델의 강인성과 성능 향상에 상당한 기여를 하였다.
  • 제어된 기준 베이스에서 최신 기술 수준의 결과를 달성하면서 동시에 인라인 와일드 시퀀스에서도 뛰어난 성능을 보여, 일반화 능력의 타당성을 입증하였다.
  • 중간 감독 및 보조 작업의 사용은 특징 학습을 향상시켜 3D 관절 위치 예측의 정확도 향상에 기여하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.