Skip to main content
QUICK REVIEW

[논문 리뷰] Occluded Human Body Capture with Self-Supervised Spatial-Temporal Motion Prior

Buzhen Huang, Yuan Shu|arXiv (Cornell University)|2022. 07. 12.
Human Pose and Action Recognition인용 수 4
한 줄 요약

이 논문은 비차폐 데이터에서 학습한 자기지도 학습 공간-시간 운동 사전을 제안하여, 차폐 상황에서 단일 카메라 3D 인간 운동 캡처 성능을 향상시킨다. 2D 운동을 맵으로 인코딩하고 차폐를 합성함으로써, 마스크된 이미지 모델링을 사용해 관절 수준의 공간-시간 네트워크를 훈련시키며, 실제 차폐 영상에서 정확하고 일관된 3D 운동 복원을 달성한다. 이는 뛰어난 일반화 능력과 효율성을 보인다.

ABSTRACT

Although significant progress has been achieved on monocular maker-less human motion capture in recent years, it is still hard for state-of-the-art methods to obtain satisfactory results in occlusion scenarios. There are two main reasons: the one is that the occluded motion capture is inherently ambiguous as various 3D poses can map to the same 2D observations, which always results in an unreliable estimation. The other is that no sufficient occluded human data can be used for training a robust model. To address the obstacles, our key-idea is to employ non-occluded human data to learn a joint-level spatial-temporal motion prior for occluded human with a self-supervised strategy. To further reduce the gap between synthetic and real occlusion data, we build the first 3D occluded motion dataset~(OcMotion), which can be used for both training and testing. We encode the motions in 2D maps and synthesize occlusions on non-occluded data for the self-supervised training. A spatial-temporal layer is then designed to learn joint-level correlations. The learned prior reduces the ambiguities of occlusions and is robust to diverse occlusion types, which is then adopted to assist the occluded human motion capture. Experimental results show that our method can generate accurate and coherent human motions from occluded videos with good generalization ability and runtime efficiency. The dataset and code are publicly available at \url{https://github.com/boycehbz/CHOMP}.

연구 동기 및 목표

  • 동일한 2D 관측치에 대해 여러 3D 자세가 대응될 수 있는, 단일 카메라 영상에서의 3D 인간 운동 캡처의 본질적 모호성 해결
  • 실제 차폐 3D 운동 데이터 부족 문제를 해결하기 위해, 새로운 합성-실제 일반화 가능 기준을 구축함으로써 강력한 모델 훈련 가능
  • 비차폐 데이터에서 학습한 관절 수준의 공간-시간 상관관계를 활용해, 차폐 상황에서의 운동 정확도와 시간적 일관성 향상
  • 실제 차폐 레이블이 필요 없이 모호성을 줄이는 운동 사전을 학습하기 위한 자기지도 학습 전략 개발
  • 실시간 성능을 위해 시간적 및 운동학적 사전을 활용하는 경량 네트워크를 훈련해 효율적인 추론 구현

제안 방법

  • 공간적 및 시간적 정보를 동시에 인코딩할 수 있도록 2D 인간 운동을 운동 맵으로 표현함으로써, 비차폐 데이터에 일관된 차폐 합성 가능
  • 자기지도 학습 전훈 중에 다양한 차폐 유형을 시뮬레이션하기 위해 비차폐 2D 운동 맵에 현실적인 차폐를 합성
  • 완전한 운동 맵을 차폐된 입력에서 복원하는 자기지도 학습 마스크된 이미지 모델링(MIM) 작업 설계를 통해 강력한 운동 사전 학습
  • 관절 수준의 공간 상관관계와 전역 운동 의존성을 모델링하기 위해 확장된 컨볼루션과 비전 트랜스포머 블록을 조합한 공간-시간 레이어 설계
  • 자기지도 학습 사전를 사용해 라이팅 네트워크를 훈련시켜, 실제 차폐 상황에서 가시 2D 관절에서의 3D 운동 추정 유도
  • 추론 시 최신 2D 자세 검출기로 가시 관절 좌표를 추출하고, 이를 모델에 입력해 전체 3D 운동 예측

실험 결과

연구 질문

  • RQ1비차폐 데이터에서 학습한 자기지도 학습 사전이 차폐 상황에서 3D 인간 운동 추정의 모호성을 효과적으로 줄일 수 있는가?
  • RQ2순수 시간 모델 대비 관절 수준의 공간-시간 모델링이 차폐 상황에서 운동의 일관성과 정확도를 어떻게 향상시키는가?
  • RQ3실제 차폐 레이블 없이도 다양한 차폐 유형과 비율에 대해 얼마나 잘 일반화되는가?
  • RQ4비차폐 데이터에 합성된 차폐가 실제 세계의 차폐 데이터와의 도메인 갭을 효과적으로 메울 수 있는가?
  • RQ5자기지도 학습 사전 통합이 엔드 투 엔드 최적화 기반 방법 대비 런타임 효율성과 예측 품질을 어떻게 향상시키는가?

주요 결과

  • 제안된 방법은 OcMotion 데이터셋에서 평균 MPJPE 58.2 mm를 달성하여 기준 시간 모델(70.5 mm)과 분석 변형보다 유의미하게 뛰어남
  • 자기지도 학습 사전과 공간-시간 레이어를 추가함으로써 기준 모델 대비 MPJPE는 12.3% 감소하고, PVE는 12.1% 감소
  • 0%에서 50%까지 다양한 차폐 비율에 대해 안정적인 성능 유지를 보이며, 비율 변화에 따른 성능 저하 최소화
  • 자기지도 학습 사전의 포함으로 PA-MPJPE가 사전 없이 43.2 mm에서 36.1 mm로 향상되어 관절 수준 정확도 향상 확인
  • 추론 속도 36.4 FPS를 달성하여 실시간 응용에 적합한 높은 런타임 효율성 확보
  • 분석 연구를 통해 공간-시간 레이어와 자기지도 학습 사전가 모두 필수적임을 확인하며, 전체 모델이 변형보다 큰 성능 향상 기록

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.