Skip to main content
QUICK REVIEW

[논문 리뷰] Towards Robust and Expressive Whole-body Human Pose and Shape Estimation

Hui EnPang, Zhongang Cai|arXiv (Cornell University)|2023. 12. 14.
Human Pose and Action Recognition인용 수 7
한 줄 요약

이 논문은 단일 RGB 이미지에서 정교하고 강건한 전신 인간 자세 및 형태 추정을 위한 새로운 프레임워크인 RoboSMPLX를 제안한다. 정확한 신체 부위 정위치를 위한 로컬라이제이션 모듈, 데이터 증강에 대한 특징 강건성을 향상시키기 위한 대비 특징 추출 모듈, 그리고 기하학적 렌더링을 이용한 미세한 메쉬 투영을 보장하기 위한 픽셀 정렬 모듈을 통합하였다. 이 방법은 몸, 손, 얼굴 및 전신 벤치마크에서 최신 기술 수준의 성능을 달성하며, MPJPE 및 PVE와 같은 핵심 지표에서 뚜렷한 향상을 보였다.

ABSTRACT

Whole-body pose and shape estimation aims to jointly predict different behaviors (e.g., pose, hand gesture, facial expression) of the entire human body from a monocular image. Existing methods often exhibit degraded performance under the complexity of in-the-wild scenarios. We argue that the accuracy and reliability of these models are significantly affected by the quality of the predicted extit{bounding box}, e.g., the scale and alignment of body parts. The natural discrepancy between the ideal bounding box annotations and model detection results is particularly detrimental to the performance of whole-body pose and shape estimation. In this paper, we propose a novel framework to enhance the robustness of whole-body pose and shape estimation. Our framework incorporates three new modules to address the above challenges from three perspectives: extbf{1) Localization Module} enhances the model's awareness of the subject's location and semantics within the image space. extbf{2) Contrastive Feature Extraction Module} encourages the model to be invariant to robust augmentations by incorporating contrastive loss with dedicated positive samples. extbf{3) Pixel Alignment Module} ensures the reprojected mesh from the predicted camera and body model parameters are accurate and pixel-aligned. We perform comprehensive experiments to demonstrate the effectiveness of our proposed framework on body, hands, face and whole-body benchmarks. Codebase is available at \url{https://github.com/robosmplx/robosmplx}.

연구 동기 및 목표

  • 실외 조건에서 기존의 전신 자세 및 형태 추정 방법의 낮은 강건성 문제를 해결하기 위해, 특히 신뢰할 수 없는 부위 자르기 품질로 인한 영향을 줄이기 위해.
  • 특히 손과 얼굴처럼 작고 가려진 신체 부위에 대해 정위치를 향상시킴으로써 모델 신뢰도를 높이기 위해.
  • 다양한 데이터 증강에 대해 불변 표현을 학습함으로써 대비 학습을 통해 특징 강건성을 향상시키기 위해.
  • 기하학적 렌더링을 통해 예측된 3D 메쉬와 2D 이미지 간의 정확한 픽셀 수준 정렬을 보장하기 위해.
  • 자세, 형태, 표정, 카메라 파rameter를 함께 최적화하는 통합 프레임워크를 개발하여 일반화 능력과 일관성을 향상시키기 위해.

제안 방법

  • 로컬라이제이션 모듈은 공동 위치와 부위 세그멘테이션 마스크를 학습하기 위한 희소 및 밀도 예측 브랜치를 사용하여, 이미지 내에서 주체 위치와 의미 정보에 대한 인식을 향상시킨다.
  • 대비 특징 추출 모듈은 자세 및 형태에 민감한 대비 손실을 적용하고 전용 양성 샘플을 활용하여, 강건한 증강 조건 하에서도 일관된 특징 표현을 유도한다.
  • 픽셀 정렬 모듈은 기하학적 렌더링을 활용하여 메쉬 투영을 정밀하게 보정하고, 렌더링된 2D 정점과 진짜 이미지 특징 간의 격차를 최소화한다.
  • 이 프레임워크는 이러한 모듈들을 통합하여 3D 메쉬 재구성, 카메라 파rameter, 형태 파rameter를 함께 최적화하는 종단 간 엔드 투 엔드 학습 파이프라인을 구축한다.
  • 기하학적 정확도와 특징 일관성을 향상시키기 위해 관절, 세그멘테이션, 투영 손실을 포함한 다중 작업 감독을 사용한다.
  • 모델은 3D 인간 벤치마크를 포함한 다양한 데이터셋에서 학습되며, 성능 저하를 초래할 수 있는 전역 변환(뒤집기, 회전 등)을 피하면서 강력한 데이터 증강을 활용한다.

실험 결과

연구 질문

  • RQ1신체 부위의 정확하지도 않거나 일관되지 않은 정위치는 전신 자세 및 형태 추정 성능에 어떤 영향을 미치는가?
  • RQ2자세 및 형태에 민감한 양성 샘플을 활용한 대비 학습은 데이터 증강 하에서 특징 강건성을 향상시키는가?
  • RQ3기하학적 렌더링은 예측된 3D 메쉬와 2D 이미지 관찰 간의 픽셀 수준 정렬을 어느 정도 향상시키는가?
  • RQ4제안된 모듈들이 실생활 상황에서 MPJPE 및 PVE 오차를 줄이는 데 개별적으로나 종합적으로 어떤 기여를 하는가?
  • RQ5현재의 전신 추정 프레임워크는 가림, 분포 외 데이터, 다중 인물 시나리오 처리에서 어떤 한계를 지니는가?

주요 결과

  • RoboSMPLX는 전신 벤치마크에서 최신 기술 수준의 성능을 달성하였으며, 베이스라인 대비 MPJPE를 0.45 mm 감소시키고 PVE를 0.31 mm 감소시켰다.
  • 로컬라이제이션 모듈(LF)의 포함으로 MPJPE는 0.31 mm 감소하고 PVE는 0.42 mm 감소하여 정위치 정확도 향상의 효과를 입증하였다.
  • 대비 특징 추출 모듈은 MPJPE를 0.23 mm 감소시키고 PVE를 0.18 mm 감소시켜 증강 조건 하에서의 특징 강건성 향상을 보였다.
  • 기하학적 렌더링과 투영 손실(L_proj)을 활용한 픽셀 정렬 모듈은 MPJPE를 0.38 mm 감소시키고 PVE를 0.45 mm 감소시켜 메쉬-이미지 정렬을 향상시켰다.
  • 모든 세 모듈(LF + 대비 + L_proj)을 결합한 경우 최고의 성능을 기록하였으며, 전신 벤치마크에서 MPJPE는 7.33 mm, PVE는 14.59 mm를 기록하였다.
  • 제거 실험 결과, 큰 스케일 및 저잡음 인자로 인한 강력한 증강이 성능을 떨어뜨리는 것으로 확인되어, 증강 설계 시 신중함이 중요함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.