Skip to main content
QUICK REVIEW

[논문 리뷰] 3D Human Shape and Pose from a Single Low-Resolution Image with Self-Supervised Learning

Xiangyu Xu, Hao Chen|arXiv (Cornell University)|2020. 07. 27.
Advanced Vision and Imaging참고 문헌 54인용 수 4
한 줄 요약

이 논문은 단일 저해상도 이미지에서 3D 인간 자세와 형태를 추정하기 위해 자기지도학습 및 대조학습을 사용하는 해상도 인식 딥 네트워크인 RSC-Net을 제안한다. 다양한 해상도 간에 출력과 특징이 해상도 일致하도록 강제함으로써, 고해상도 감독이나 초해상도 전처리 없이도 최신 기술 수준의 성능을 달성한다.

ABSTRACT

3D human shape and pose estimation from monocular images has been an active area of research in computer vision, having a substantial impact on the development of new applications, from activity recognition to creating virtual avatars. Existing deep learning methods for 3D human shape and pose estimation rely on relatively high-resolution input images; however, high-resolution visual content is not always available in several practical scenarios such as video surveillance and sports broadcasting. Low-resolution images in real scenarios can vary in a wide range of sizes, and a model trained in one resolution does not typically degrade gracefully across resolutions. Two common approaches to solve the problem of low-resolution input are applying super-resolution techniques to the input images which may result in visual artifacts, or simply training one model for each resolution, which is impractical in many realistic applications. To address the above issues, this paper proposes a novel algorithm called RSC-Net, which consists of a Resolution-aware network, a Self-supervision loss, and a Contrastive learning scheme. The proposed network is able to learn the 3D body shape and pose across different resolutions with a single model. The self-supervision loss encourages scale-consistency of the output, and the contrastive learning scheme enforces scale-consistency of the deep features. We show that both these new training losses provide robustness when learning 3D shape and pose in a weakly-supervised manner. Extensive experiments demonstrate that the RSC-Net can achieve consistently better results than the state-of-the-art methods for challenging low-resolution images.

연구 동기 및 목표

  • 감시 및 스포츠 방송과 같은 실제 응용에서 흔한 저해상도 이미지에서 3D 인간 자세와 형태 추정 문제를 해결한다.
  • 기존 방법들이 고해상도 입력에 의존하거나 다양한 해상도 간 일반화 능력이 떨어지는 한계를 극복한다.
  • 실제 데이터셋에서 고품질 3D 애너테이션의 부족을 해소하기 위해 해상도 일致하는 감독을 활용한 자기지도학습을 도입한다.
  • 다양한 척도에서의 특징 간 상호정보량을 최대화함으로써, 대조학습을 통해 특징 표현의 강인성을 향상시킨다.
  • 개별 모델이나 초해상도 전처리 없이도 임의의 입력 해상도에 일반화 가능한 단일 모델 솔루션을 개발한다.

제안 방법

  • 다양한 해상도 간 공유된 특징 추출기와 해상도별로 특화된 파rameter를 사용해 특징을 적응적으로 통합하는 해상도 인식 네트워크 아키텍처를 제안한다.
  • 동일한 이미지의 다양한 해상도에서 예측의 일관성을 강제하는 방향성 자기지도학습 손실을 도입하며, 고해상도 출력을 저해상도 입력의 소프트 감독으로 사용한다.
  • 코사인 유사도 기반 대조 특징 손실을 설계하여, 동일한 이미지의 서로 다른 해상도에서 추출한 깊은 특징 간 상호정보량을 최대화함으로써 특징 강인성을 향상시킨다.
  • 다양한 해상도 입력에서 학습할 때 최적화를 안정화하기 위해 점진적 훈련을 도입하며, 점차적으로 저해상도 데이터를 도입한다.
  • 자기지도학습 손실에서 계층적 감독을 채택하여 고해상도 예측을 기반으로 저해상도 예측을 안내함으로써 훈련의 안정성과 정확도를 향상시킨다.
  • 해상도 인식 네트워크, 자기지도학습 손실, 대조 특징 손실을 통합하여 약한 감독 하에 3D 추정을 위한 유일한 훈련 목표를 구성한다.

실험 결과

연구 질문

  • RQ1재학습이나 초해상도 전처리 없이도, 단일 딥 네트워크가 다양한 저해상도 입력에 대해 효과적으로 3D 인간 자세와 형태를 추정할 수 있는가?
  • RQ2고품질 3D 애너테이션이 부족하거나 이용 불가능한 상황에서 자기지도학습을 어떻게 효과적으로 활용해 3D 추정 성능을 향상시킬 수 있는가?
  • RQ3대조학습을 통한 해상도 간 특징 일관성 강제가 기존의 MSE 기반 손실 대비 더 나은 일반화 및 강인성을 제공하는가?
  • RQ4고해상도 가이던스를 우선시하는 방향성 자기지도학습 전략이 대칭적 감독 대비 저해상도 입력에서 성능 향상에 기여하는가?
  • RQ5점진적 훈련이 다중 해상도 3D 추정 모델의 수렴과 성능에 어떤 영향을 미치는가?

주요 결과

  • RSC-Net은 저해상도 3D 인간 자세 및 형태 추정에서 최신 기술 수준의 성능을 달성하며, 테스트된 모든 해상도에서 기존 방법을 뛰어넘는다.
  • 해상도 인식 네트워크, 자기지도학습 손실, 대조 특징 손실의 조합은 가장 낮은 해상도(32×32)에서 MPJPE를 96.36으로 줄였으며, 점진적 훈련 없이 기준 모델(105.11)보다 유의미하게 뛰어나다.
  • 방향성 자기지도학습 손실(8)은 원래 대칭 자기지도학습 손실 대비 32×32 해상도에서 MPJPE를 8.75 향상시켜 고해상도 가이던스를 효과적으로 활용함을 입증한다(143.31 vs. 105.11).
  • 대조 특징 손실(CL)은 MSE 기반 특징 일관성 손실(MS)보다 우수하여 32×32 해상도에서 MPJPE를 11.44 감소시켰다(117.12 vs. 128.56), 고차원 특징 정렬에서의 우수성을 확인한다.
  • 점진적 훈련은 필수적이다: 이를 생략할 경우 32×32 해상도에서 MPJPE가 8.75 증가한다(127.05 vs. 117.12), 이는 다중 해상도 데이터에 대한 훈련 안정화에 기여함을 보여준다.
  • 완전한 모델(RA+SS+CL)은 32×32 해상도에서 58.98 MPJPE-PA를 달성하여 초해상도 전처리 없이도 극단적인 저해상도 입력에 대해 강인성과 일반화 능력을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.