Skip to main content
QUICK REVIEW

[논문 리뷰] LiveCap: Real-time Human Performance Capture from Monocular Video

Marc Habermann, Weipeng Xu|arXiv (Cornell University)|2018. 10. 05.
3D Shape Modeling and Analysis참고 문헌 95인용 수 9
한 줄 요약

LiveCap는 단일 RGB 영상에서 전체 신체 운동, 특히 느슨한 옷차림까지 포함한 고밀도, 공간-시간적으로 일관된 3D 재구성에 있어 실시간으로 작동하는 최초의 단안 영상 기반 방법을 제안한다. 이는 GPU 가속, 데이터 병렬화된 가우스-뉴턴 해법을 사용하는 이단계 최적화 기반으로, 뼈대가 있는 템플릿을 2D/3D 관절, 얼굴 랜드마크, 윤곽선에 동시에 피팅한 후, 재료 인식 에너지 함수를 사용하여 고밀도 비정상적 변형을 추적함으로써, 25Hz 이상의 성능을 달성하면서도 오프라인 방법과 유사한 정확도를 확보한다.

ABSTRACT

We present the first real-time human performance capture approach that reconstructs dense, space-time coherent deforming geometry of entire humans in general everyday clothing from just a single RGB video. We propose a novel two-stage analysis-by-synthesis optimization whose formulation and implementation are designed for high performance. In the first stage, a skinned template model is jointly fitted to background subtracted input video, 2D and 3D skeleton joint positions found using a deep neural network, and a set of sparse facial landmark detections. In the second stage, dense non-rigid 3D deformations of skin and even loose apparel are captured based on a novel real-time capable algorithm for non-rigid tracking using dense photometric and silhouette constraints. Our novel energy formulation leverages automatically identified material regions on the template to model the differing non-rigid deformation behavior of skin and apparel. The two resulting non-linear optimization problems per-frame are solved with specially-tailored data-parallel Gauss-Newton solvers. In order to achieve real-time performance of over 25Hz, we design a pipelined parallel architecture using the CPU and two commodity GPUs. Our method is the first real-time monocular approach for full-body performance capture. Our method yields comparable accuracy with off-line performance capture techniques, while being orders of magnitude faster.

연구 동기 및 목표

  • 단일 RGB 영상 스트림으로부터 전체 신체 운동과 변형을 실시간으로 고밀도 3D 재구성하는 것을 목표로 한다.
  • 사전 학습된 템플릿을 활용하여 피부 및 의류 영역이 분할된 영역을 통해 단안 영상의 높은 모호성과 부족한 제약 조건을 극복한다.
  • 공급망 하드웨어에서 실시간 성능(25Hz 이상)을 달성하면서도 공간-시간적 일관성과 높은 기하학적 정확도를 유지한다.
  • 다중 시야 또는 깊이 센서 없이도 복잡한 느슨한 옷차림의 변형을 지원한다.
  • 특수한 카메라 어레이나 통제된 환경이 필요 없이 고품질 성능 캡처를 일반화한다.

제안 방법

  • 이중단계 분석-합성 최적화: 먼저 실시간 뼈대 자세 최적화기로 2D/3D 관절 위치, 얼굴 랜드마크, 배경 분離 윤곽선에 대해 뼈대가 있는 템플릿을 거칠게 피팅한다.
  • 두 번째 단계에서는 새로운 에너지 설정을 사용하여 고밀도 비정상적 추적을 수행하며, 광학적, 윤곽선, 공간-시간 정규화 항목을 조합한다.
  • 사전 처리 단계에서 다중 시야 딥러닝 기반 분할 파이프라인을 통해 확보된 분할 레이블을 활용해 피부와 의류 영역 간의 변형 행동을 구분하는 에너지 함수를 설계한다.
  • 비선형 최적화 문제는 CPU와 두 개의 GPU에서 파이프라인 아키텍처로 작동하는 특수하게 설계된 데이터 병렬 가우스-뉴턴 해법을 통해 해결한다.
  • ICP 대체로 거리장 기반 윤곽선 정렬을 사용하여 더 빠르고 GPU에 유리한 계산을 수행하며, 비용이 많이 드는 대응 검색을 방지한다.
  • 사전 촬영된 정적 영상 자료를 이용해 뼈대가 있는 표면 및 외관 템플릿을 구축하고, 자동으로 재료 영역을 식별한다.

실험 결과

연구 질문

  • RQ1단일 단안 RGB 영상 스트림으로부터 실시간으로 고밀도, 공간-시간적으로 일관된 3D 인간 기하 구조를 재구성할 수 있는가?
  • RQ2단일 시야에서만 이용 가능한 상황에서 느슨한 옷차림의 비정상적 변형을 정확히 모델링하고 추적할 수 있는가?
  • RQ325Hz 이상의 속도로 작동하면서도 오프라인 다중 시야 성능 캡처 방법과 유사한 성능 품질을 달성할 수 있는가?
  • RQ4단일 시야 실시간 환경에서 피부와 의류 간의 재료 특화 변형 행동을 효과적으로 모델링할 수 있는가?
  • RQ5일반 소비자 하드웨어에서 실시간 성능을 달성하기 위해 필요한 아키텍처적 및 알고리즘 최적화는 무엇인가?

주요 결과

  • LiveCap는 일반 소비자 하드웨어에서 25Hz 이상의 실시간 성능을 달성하여 VR, AR, 원격 존재와 같은 상호작용형 응용을 가능하게 한다.
  • 이 방법은 느슨한 옷차림까지 포함한 전체 신체 운동에 대해 고밀도, 공간-시간적으로 일관된 3D 재구성을 생성하며, 최신 오프라인 성능 캡처 기술과 유사한 정확도를 확보한다.
  • 재료 인식 변형 모델링의 사용은 특히 동적인 비정상적 의류에 대해 재구성 품질을 크게 향상시킨다.
  • 부분적 및 자기 음영에 대해 강건하며, 이전에 음영이 있었던 영역이 다시 노출될 경우 신속하게 복구한다.
  • 한계점으로는 낮은 정확도의 전경 분할에 민감하고, 훈련 데이터 분포 외의 극단적 자세, 반사성 재료 또는 강한 조명 변화에 대한 도전이 있다.
  • 단안 영상의 모호성에도 불구하고, 시간적 안정성을 유지하고 공동 최적화를 통해 일부 잘못된 관절 예측을 수정한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.