Skip to main content
QUICK REVIEW

[논문 리뷰] Polarization Human Shape and Pose Dataset

Shihao Zou, Xinxin Zuo|arXiv (Cornell University)|2020. 04. 30.
Optical measurement and interference techniques참고 문헌 5인용 수 6
한 줄 요약

이 논문은 12명의 피험자가 다양한 인간 동작을 수행하는 것을 촬영한 동기화된 편광, 색상 및 깊이 영상 데이터를 포함하는 새로운 다중 시점 데이터셋인 Polarization Human Shape and Pose Dataset (PHSPD)를 소개한다. 저자들은 운동 캡처 수트나 특수 의복 없이도 정확한 3D 신체 재구성을 가능하게 하는 저비용이고 효과적인 3D 인간 자세 및 형태 주석 처리 파이프라인(모델 기반 SMPL 피팅 및 포인트 클라우드 정밀 조정)을 제안한다. 학술적 목적을 위해 총 282,112개의 주석 처리 프레임을 제공한다.

ABSTRACT

Polarization images are known to be able to capture polarized reflected lights that preserve rich geometric cues of an object, which has motivated its recent applications in reconstructing detailed surface normal of the objects of interest. Meanwhile, inspired by the recent breakthroughs in human shape estimation from a single color image, we attempt to investigate the new question of whether the geometric cues from polarization camera could be leveraged in estimating detailed human body shapes. This has led to the curation of Polarization Human Shape and Pose Dataset (PHSPD), our home-grown polarization image dataset of various human shapes and poses.

연구 동기 및 목표

  • 운동 캡처 시스템에 비해 비용이 많이 들지 않는 실용적인 대안을 개발하여 3D 인간 자세 및 형태 주석 처리를 수행하는 것.
  • 편광 영상이 인간 신체 재구성에 필요한 기하학적 정보를 제공할 수 있는지 탐색하는 것.
  • 3D 인간 분석을 위한 동기화된 편광, 색상 및 깊이 데이터를 포함한 대규모 공개 데이터셋을 구축하는 것.
  • 운동 캡처 수트나 특수 의복 없이도 표준 RGB-D 카메라와 편광 카메라만으로도 정확한 3D 인간 신체 자세 및 형태 추정을 가능하게 하는 것.
  • 표면 법선 및 형태 추정 향상을 위해 편광 정보를 활용하는 모델 훈련을 위한 기반을 마련하는 것.

제안 방법

  • 소켓 통신을 통한 소프트 동기화 프로토콜을 사용하여 1대의 편광 카메라와 3대의 Kinect v2 카메라(각각 색상 및 깊이 영상 제공)를 동기화하여 최대 15 fps의 성능을 달성한다.
  • OpenPose와 Kinect의 검출 결과를 융합하여 다중 시점 RGB-D 데이터를 기반으로 초기 3D 관절 위치를 추정하며, 관절 일致성 검증을 위해 50픽셀 이내의 임계값을 적용한다.
  • 초기 3D 자세 추정치에 SMPL 모델 피팅을 적용하며, 형태(β ∈ ℝ¹⁰)와 자세(θ ∈ ℝ⁷²) 매개변수를 3D 메쉬(6890개 정점)로 매핑하는 미분 가능 함수를 사용한다.
  • 메쉬 정점과 3D 인간 표면 포인트 클라우드의 가장 가까운 점 사이의 거리를 최소화하여 반복적인 정밀 조정을 수행함으로써 정렬 정확도를 향상시킨다.
  • 노이즈가 있는 다중 시점 깊이 데이터로부터도 배경 마스크를 생성하고 표면 법선을 추정하여 법선 예측 작업을 지원한다.
  • 긴 시퀀스를 12개의 일반 동작 클래스와 34개의 세분화된 동작 클래스로 나누어 총 1061개의 동작 클립으로 분할하여 행동 인식 평가를 가능하게 한다.

실험 결과

연구 질문

  • RQ1편광 영상가 3D 인간 신체 자세 및 형태 추정에 필요한 기하학적 정보를 충분히 제공할 수 있는가?
  • RQ2표준 RGB-D 카메라와 편광 카메라를 사용하는 저비용 비침습적 설정이 운동 캡처 수트나 마커 없이도 정확한 3D 인간 신체 주석 처리를 가능하게 하는가?
  • RQ3SMPL 피팅과 포인트 클라우드 정밀 조정을 조합한 방법이 다중 시점 데이터로부터 실제 인간 피험자에 대한 3D 신체 모델을 얼마나 잘 정렬하는가?
  • RQ4제안된 주석 처리 파이프라인이 다양한 인간 자세와 동작에 걸쳐 일관되고 정확한 3D 형태 및 자세 주석 처리를 생성할 수 있는가?
  • RQ5이 데이터셋으로 훈련된 모델이 편광 및 다중 시점 영상을 활용하여 표면 법선과 인간 자세를 얼마나 잘 예측하는가?

주요 결과

  • 12명의 피험자(남성 9명, 여성 3명)로부터 282,112개의 주석 처리 프레임을 확보하였으며, 총 18개의 동작이 4회 반복 및 자유형 시퀀스로 촬영되었다.
  • 다중 시점 Kinect 데이터 융합 및 포인트 클라우드 기반 SMPL 매개변수 정밀 조정을 통해 뼈대만을 기반으로 한 피팅보다 정렬 오차를 감소시켜 높은 정확도를 달성한다.
  • 최대 15 fps에서 실시간 동기화를 구현하였으며, 시간적 지터가 최소화되었으며, 모든 4개의 카메라 뷰에서 낙하하는 가방을 추적하여 검증되었다.
  • 12개의 일반 동작 클래스와 34개의 세분화된 동작 클래스로 나누어 총 1061개의 동작 클립이 포함되어 있어 행동 인식 및 인간 운동 모델링 평가가 가능하다.
  • 깊이 기반 법선 추정에 노이즈가 있음에도 불구하고, 이 데이터셋으로 훈련된 최종 모델은 매끄럽고 정확한 표면 법선 맵을 학습한다.
  • 이 데이터셋은 학술 목적 외에는 사용이 금지되며, Human3.6M와 같은 운동 캡처 기반 데이터셋에 비해 확장 가능하고 저비용의 대안을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.