Skip to main content
QUICK REVIEW

[논문 리뷰] DeepMultiCap: Performance Capture of Multiple Characters Using Sparse Multiview Cameras

Yang Zheng, Ruizhi Shao|arXiv (Cornell University)|2021. 05. 01.
Advanced Vision and Imaging참고 문헌 66인용 수 4
한 줄 요약

DeepMultiCap는 사전 스캔된 템플릿이 필요 없이 희소한 다중 시점 RGB 영상에서 고해상도 다중 인물 성능 캡처를 위한 새로운 방법을 제안한다. 공간 주의 메커니즘, SMPL 기반 3D 사전 지식, 그리고 시간적 융합 전략을 결합함으로써 심각한 가림과 시간적 불일치 상황에서도 최신 기술 수준의 재구성 성능를 달성한다. 이는 새로운 고품질 데이터셋인 MultiHuman에서 검증되었다.

ABSTRACT

We propose DeepMultiCap, a novel method for multi-person performance capture using sparse multi-view cameras. Our method can capture time varying surface details without the need of using pre-scanned template models. To tackle with the serious occlusion challenge for close interacting scenes, we combine a recently proposed pixel-aligned implicit function with parametric model for robust reconstruction of the invisible surface areas. An effective attention-aware module is designed to obtain the fine-grained geometry details from multi-view images, where high-fidelity results can be generated. In addition to the spatial attention method, for video inputs, we further propose a novel temporal fusion method to alleviate the noise and temporal inconsistencies for moving character reconstruction. For quantitative evaluation, we contribute a high quality multi-person dataset, MultiHuman, which consists of 150 static scenes with different levels of occlusions and ground truth 3D human models. Experimental results demonstrate the state-of-the-art performance of our method and the well generalization to real multiview video data, which outperforms the prior works by a large margin.

연구 동기 및 목표

  • 사전 스캔된 템플릿이 없는 희소한 다중 시점 RGB 영상에서 고해상도 다중 인물 3D 성능 캡처를 가능하게 하는 것.
  • 상호작용이 빈번한 장면에서의 심각한 가림 문제를 암시적 함수와 매arametric SMPL 모델을 결합한 3D 기하 구조 대체 수단으로 해결하는 것.
  • 다중 시점 특징 융합을 위한 공간 주의 인식 모듈을 통해 세밀한 기하학적 디테일 복원을 향상시키는 것.
  • 새로운 SDF 기반 시간적 융합 방법을 통해 다이나믹 시퀀스의 시간 일관성을 향상시키는 것.
  • 다양한 가림 수준을 가진 150개의 고품질 다중 인물 상호작용 장면을 포함한 새로운 고품질 벤치마크 데이터셋인 MultiHuman을 제공하는 것.

제안 방법

  • 다양한 시점에서의 고주파 기하학적 디테일을 강조하기 위해 다중 시점 특징을 적응적으로 융합하는 공간 주의 인식 모듈을 설계하였다.
  • 전역 노말 맵을 이용해 주의를 유도하고 강건성을 향상시키기 위해 SMPL을 3D 사전 지식으로 통합하여 가림 영역에서 완전한 인간 몸체를 재구성하였다.
  • 영상 프레임 간의 서피스 거리 함수(SDF)를 가중 평균하여 노이즈를 감소시키고 다이나믹 재구성에서 시간 일관성을 향상시키는 새로운 시간적 융합 전략을 제안하였다.
  • 픽셀 정렬된 암시적 함수를 사용하여 3D 기하 구조를 표현함으로써 다중 시점 이미지에서 효율적이고 세밀한 표면 재구성 가능성을 확보하였다.
  • 새로운 데이터셋인 MultiHuman(150개의 고품질 다중 인물 상호작용 장면, 다양한 가림 수준 포함)을 사용하여 시스템을 훈련 및 평가하였다.

실험 결과

연구 질문

  • RQ1딥러닝 기반 방법이 사전 스캔된 템플릿 없이 희소한 다중 시점 RGB 영상에서 다수의 상호작용하는 인간의 고해상도 3D 재구성을 달성할 수 있는가?
  • RQ23D 사전 지식과 주의 메커니즘의 조합을 통해 다중 인물 성능 캡처에서 심각한 가림 문제를 어떻게 완화할 수 있는가?
  • RQ3공간 주의 모듈은 다중 시점 3D 재구성에서 세밀한 기하학적 디테일 복원에 얼마나 기여하는가?
  • RQ4시간적 융합 전략은 다이나믹 3D 시퀀스에서 노이즈와 시간적 불일치를 얼마나 효과적으로 감소시키는가?
  • RQ5다양한 가림 수준을 가진 다중 인물, 가림된 장면으로 구성된 새로운 고품질 데이터셋이 성능 캡처 시스템 평가에 신뢰할 수 있는 벤치마크로 기능할 수 있는가?

주요 결과

  • DeepMultiCap는 다중 인물 성능 캡처에서 최신 기술 수준의 성능를 달성하였으며, 시뮬레이션 및 실세계 데이터 모두에서 기존 방법들을 크게 앞서는 성능를 보였다.
  • 공간 주의 인식 모듈은 노말 맵과 같은 고주파 디테일을 포함한 재구성 품질을 크게 향상시켰다.
  • SMPL을 3D 프록시로 통합함으로써 가림된 신체 부위의 재구성도 강력하게 가능했으며, 제거 실험 결과에서 정확도가著 떨어지는 것으로 확인되었다.
  • 시간적 융합 방법은 정성적 비교 및 보조 영상에서 시간적 아티팩트를 감소시키고 다이나믹 시퀀스의 일관성을 향상시켰다.
  • 다양한 가림 수준을 가진 150개의 고품질 다중 인물 상호작용 장면을 포함한 MultiHuman 데이터셋은 다중 인물 성능 캡처 시스템의 세밀하고 신뢰할 수 있는 평가를 가능하게 하였다.
  • 실세계 다중 시점 영상 데이터에 대해 강력한 일반화 성능를 보이며, 도전적인 가림 조건에서도 고해상도 결과를 생성하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.