Skip to main content
QUICK REVIEW

[논문 리뷰] Monocular Real-Time Volumetric Performance Capture

Ruilong Li, Yuliang Xiu|arXiv (Cornell University)|2020. 07. 28.
Advanced Vision and Imaging참고 문헌 84인용 수 4
한 줄 요약

이 논문은 단일 영상 스트림에서 다중 시점 설정이나 개인 맞춤 템플릿 없이도 고해상도의 완전한 질감을 가진 3D 인간을 실시간으로 재구성하는 최초의 단일 카메라 볼륨형 성능 캡처 시스템을 제안한다. 계층적 표면 위치 결정 알고리즘과 메시 없는 렌더링을 도입함으로써 재구성 속도를 두 배수 증가시켜 256³ 해상도에서 15 fps를 달성하였으며, 온라인 하드 예외 샘플링 기법을 통해 드문 자세나 의복 스타일에 대한 강건성도 향상시켰다.

ABSTRACT

We present the first approach to volumetric performance capture and novel-view rendering at real-time speed from monocular video, eliminating the need for expensive multi-view systems or cumbersome pre-acquisition of a personalized template model. Our system reconstructs a fully textured 3D human from each frame by leveraging Pixel-Aligned Implicit Function (PIFu). While PIFu achieves high-resolution reconstruction in a memory-efficient manner, its computationally expensive inference prevents us from deploying such a system for real-time applications. To this end, we propose a novel hierarchical surface localization algorithm and a direct rendering method without explicitly extracting surface meshes. By culling unnecessary regions for evaluation in a coarse-to-fine manner, we successfully accelerate the reconstruction by two orders of magnitude from the baseline without compromising the quality. Furthermore, we introduce an Online Hard Example Mining (OHEM) technique that effectively suppresses failure modes due to the rare occurrence of challenging examples. We adaptively update the sampling probability of the training data based on the current reconstruction accuracy, which effectively alleviates reconstruction artifacts. Our experiments and evaluations demonstrate the robustness of our system to various challenging angles, illuminations, poses, and clothing styles. We also show that our approach compares favorably with the state-of-the-art monocular performance capture. Our proposed approach removes the need for multi-view studio settings and enables a consumer-accessible solution for volumetric capture.

연구 동기 및 목표

  • 단일 소비자용 카메라에서 실시간으로 고품질 볼륨형 성능 캡처를 가능하게 하여 다중 시점 시스템이나 사전 캡처된 템플릿이 필요 없도록 하는 것.
  • 기존에 프레임당 수십 초가 걸리는 Pixel-Aligned Implicit Function (PIFu)의 계산 병목 현상을 해결하여 실시간 배포가 가능한 것.
  • 드문 자세, 복잡한 의복, 다양한 조명 조건 등 도전적인 조건에 대한 재구성 강건성을 향상시키기 위해 학습 중 데이터 불균형 문제를 해결하는 것.
  • 명시적인 메시 추출 없이 직접 효율적인 신규 시점 렌더링을 구현하여 렌더링 지연을 줄이는 것.

제안 방법

  • 표면 재구성에 필요한 평가 수를 크게 줄이기 위해 굵은 톤에서 세밀한 톤으로의 계층적 접근 방식을 사용하는 표면 위치 결정 알고리즘을 제안한다.
  • 메시 추출 및 텍스처 매핑을 생략하는 직접 렌더링 기법을 도입하여 암시 함수에서 직접 렌더링함으로써 더 빠른 신규 시점 합성 가능하게 한다.
  • 재구성 오차 기반으로 학습 샘플을 적응적으로 재가중하는 온라인 하드 예외 샘플링(OHEM) 전략을 활용하여 어려운 케이스에 집중 학습하도록 한다.
  • 학습 중 어려운 예시(예: 드문 자세, 복잡한 의복)의 샘플링 확률을 높이는 점진적 샘플링 전략을 적용하여 잡음 억제 효과를 극대화한다.
  • 고해상도 암시적 3D 기하학 및 텍스처 표현을 위해 PIFu 프레임워크를 활용하면서도 공간 자르기 최적화를 통해 추론 속도를 향상시킨다.
  • 계층적 위치 결정과 암시적 텍스처 렌더링을 조합하여 256³ 해상도에서 종단 간 실시간 성능 달성.

실험 결과

연구 질문

  • RQ1단일 카메라에서 고해상도 3D 인간 성능 캡처를 재구성 품질 손실 없이 실시간 속도로 구현할 수 있는가? 다중 시점 데이터가 필요 없는가?
  • RQ2PIFu 스타일의 암시적 재구성에서 높은 계산 비용을 줄일 수 있는가? 이는 고해상도 기하학 및 텍스처를 유지하면서 가능한가?
  • RQ3합성 학습 데이터에서 드문 자세나 의복 스타일에 대한 데이터 불균형 문제를 효과적으로 완화할 수 있는가? 이는 일반화 능력 향상과 잡음 감소에 기여하는가?
  • RQ4명시적인 메시 추출 및 텍스처 메시화 없이도 실시간 신규 시점 렌더링이 가능한가?
  • RQ5학습 중 적응형 샘플링 전략을 통해 수동 데이터 정제 없이 도전적인 입력 조건에 대한 강건성을 향상시킬 수 있는가?

주요 결과

  • 제안된 계층적 표면 위치 결정 알고리즘은 PIFu 기반 재구성 속도를 두 배수 증가시켜 프레임당 추론 시간을 30초에서 0.14초로 단축시켰다.
  • 가속화된 재구성과 메시 없는 렌더링을 조합함으로써 256³ 해상도에서 전체 볼륨 렌더링에 대해 15 fps를 달성하여 실시간 성능 캡처를 실현하였다.
  • 온라인 하드 예외 샘플링(OHEM) 기법은 특히 드문 자세나 복잡한 의복에서의 재구성 잡음 억제에 크게 기여하여 전반적인 정확도와 일반화 능력을 향상시켰다.
  • 정성적 및 정량적 평가 결과, 사전 캡처된 템플릿이 없어도 최신 기술보다 정확도와 강건성 면에서 뛰어난 성능을 보였다.
  • 시스템은 토폴로지 변화와 동적 텍스처를 성공적으로 처리하여, 템플릿 기반 방법과 달리 표현력 있는 성능의 현실적인 렌더링을 가능하게 했다.
  • 이 방법은 인간을 넘어서 모든 물체나 토폴로지에 적용 가능하므로, 소비자용 카메라에서 실시간 3D 캡처를 위한 확장 가능한 기반 기술이 될 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.