[논문 리뷰] DeepCap: Monocular Human Performance Capture Using Weak Supervision
DeepCap는 단일 카메라 영상과 개인 맞춤형 템플릿 메시만을 사용하여 3D 골격 자세와 비정형 표면 변형을 동시에 회귀하는 약한 지도 학습 기반 딥러닝 방법을 제안한다. 기하학적 재구성 정확도와 시간적 일관성 면에서 최신 기술을 초월하며, 특히 도전적인 자세에서 강건성을 확보한다. 이는 미분 가능 렌더링과 분석-통합 학습 방식을 통해 훈련된다.
Human performance capture is a highly important computer vision problem with many applications in movie production and virtual/augmented reality. Many previous performance capture approaches either required expensive multi-view setups or did not recover dense space-time coherent geometry with frame-to-frame correspondences. We propose a novel deep learning approach for monocular dense human performance capture. Our method is trained in a weakly supervised manner based on multi-view supervision completely removing the need for training data with 3D ground truth annotations. The network architecture is based on two separate networks that disentangle the task into a pose estimation and a non-rigid surface deformation step. Extensive qualitative and quantitative evaluations show that our approach outperforms the state of the art in terms of quality and robustness.
연구 동기 및 목표
- 3D 지도 데이터가 없는 단일 영상에서 밀도 높은 공간-시간 일관성 있는 3D 인간 성능 캡처를 가능하게 하기 위해.
- 기존 단일 영상 방법이 전신 비정형 변형을 포착하지 못하거나 시간적 일관성이 떨어지는 한계를 극복하기 위해.
- 비용이 많이 드는 3D 애노테이션을 제거하기 위해 다중 시점 영상과 템플릿 메시만을 사용하는 약한 지도 학습 틀을 개발하기 위해.
- 그래픽스 친화적이고 사지 보존이 가능한 재구성을 위해 시간에 따라 표면 정점이 추적되는 유연한 메시 기반 표현을 생성하기 위해.
- 장애물과 평면 외 운동 하에서 복잡한 옷차림과 신체 변형을 고해상도로 재구성하기 위해.
제안 방법
- 이 방법은 두 개의 스트림으로 구성된 CNN 아키텍처를 사용한다: 하나는 골격 자세를 예측하는 포즈넷(PoseNet), 다른 하나는 메시 기반 변형 그래프의 변형 매개변수를 예측하는 디프넷(DefNet).
- 모델은 예측된 3D 메시를 2D 영상 공간으로 다시 투영하기 위한 완전히 미분 가능한 렌더링 레이어를 활용하여 다중 시점 일관성에 기반한 감독을 수행한다.
- 분석-통합 방식으로 훈련되며, 3D 감독 없이도 예측된 2D 관측값과 진짜 다중 시점 영상 간의 비교를 통해 학습이 이루어진다.
- 변형 그래프는 메시에 통합되어 있으며, 각 노드별로 회전과 이동을 매개변수화하여 국소적 비정형 표면 변형을 가능하게 한다.
- 개인 맞춤형 템플릿 메시를 사용하고, 한 번의 순방향 전파로 자세와 변형을 동시에 회귀함으로써 시간적 일관성을 확보한다.
- 손실는 다중 시점 영상의 2D 감독만을 사용하여 엔드 투 엔드로 최적화되며, 이는 약한 지도 학습을 가능하게 한다.
실험 결과
연구 질문
- RQ1단일 영상 기반 딥러닝 모델이 3D 지도 데이터 없이도 전체 신체 운동과 비정형 표면 변형을 정확하고 공간-시간 일관성 있게 재구성할 수 있는가?
- RQ2다중 시점 영상에서의 약한 감독이 3D 기하학적 정확도와 강건성 면에서 완전 지도 학습 방법과 비교해 어떻게 성능을 냈는가?
- RQ3미분 가능한 메시 표현이 장애물과 복잡한 자세 하에서도 안정적이고 사지 보존이 가능한 재구성을 가능하게 하는가?
- RQ4변형 그래프의 통합이 자세 전용 또는 스키닝 기반 방법에 비해 재구성 정밀도를 얼마나 향상시키는가?
- RQ5학습에 사용되는 시점 수와 프레임 수는 학습된 3D 재구성 품질에 어떤 영향을 미치는가?
주요 결과
- S1 시퀀스에서 DeepCap는 87.2% AMVIoU와 89.26% SVIoU를 달성하여 이전의 모든 단일 영상 방법을 능가하며, 다중 시점 기준선(91.74% AMVIoU)에 근접한다.
- S4 시퀀스에서 DeepCap는 82.53% AMVIoU와 86.66% SVIoU를 기록하여 LiveCap(59.96% AMVIoU)와 HMR(65.1% AMVIoU)를 크게 앞서며, 성능을 뛰어나게 한다.
- 학습 시 카메라 시점 수를 늘릴수록 AMVIoU는 1개 시점일 때 65.11%에서 7개 시점일 때 81.73%로 향상되어 다중 시점 감독의 유용성을 입증한다.
- 학습 데이터를 1/4에서 전체 프레임으로 늘일 경우 AMVIoU는 73.41%에서 82.53%로 상승하여 데이터 효율성과 일반화 능력 향상을 보여준다.
- PoseNet 전용 모델 대비 DefNet을 통합하면 약 4%의 AMVIoU 향상이 이루어지며, 특히 느슨한 옷차림과 스키닝 아티팩트 같은 局부 변형을 보완한다.
- S4 시퀀스에서 96.74%의 3DPCK를 달성하여 최고 성능 기준선과 동일한 높은 자세 정확도를 확보하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.