[논문 리뷰] PVA: Pixel-aligned Volumetric Avatars
이 논문은 소수의 입력 이미지에서 고해상도의 3D 인간 헤드 아바타를 고정밀도의 표정과 신원 일반화 능력으로 예측하는 새로운 신경 레디언스 필드 방법인 픽셀 정렬 볼륨 아바타(Pixel-aligned Volumetric Avatars, PVA)를 소개한다. 3D 감독 없이 사진 재구성 손실을 통해 엔드 투 엔드로 훈련되며, 새로운 시점 합성 품질 측면에서 최신 기술 수준을 달성한다.
Acquisition and rendering of photo-realistic human heads is a highly challenging research problem of particular importance for virtual telepresence. Currently, the highest quality is achieved by volumetric approaches trained in a person specific manner on multi-view data. These models better represent fine structure, such as hair, compared to simpler mesh-based models. Volumetric models typically employ a global code to represent facial expressions, such that they can be driven by a small set of animation parameters. While such architectures achieve impressive rendering quality, they can not easily be extended to the multi-identity setting. In this paper, we devise a novel approach for predicting volumetric avatars of the human head given just a small number of inputs. We enable generalization across identities by a novel parameterization that combines neural radiance fields with local, pixel-aligned features extracted directly from the inputs, thus sidestepping the need for very deep or complex networks. Our approach is trained in an end-to-end manner solely based on a photometric re-rendering loss without requiring explicit 3D supervision.We demonstrate that our approach outperforms the existing state of the art in terms of quality and is able to generate faithful facial expressions in a multi-identity setting.
연구 동기 및 목표
- 소수의 입력 이미지에서 사진 수준의 현실감 있는, 신원 일반화가 가능한 3D 인간 헤드 아바타를 생성하는 문제를 해결하기 위해.
- 볼륨 모델에서 전역 잠재 코드의 한계를 극복하여 신원과 표정 간의 일반화를 향상시키기 위해.
- 헤어와 얼굴 질감과 같은 고주파 세부 정보를 유지하면서, 새로운 신원과 시점에 대한 시각 합성 기능을 제공하기 위해.
- 3D 감독을 명시적으로 요구하지 않고, 훈련 중에 사진 재구성 손실에만 의존함으로써 3D 감독의 필요성을 제거하기 위해.
- 전역 코드가 아닌 국소적이고 이미지 기반의 특징에 조건부인 신경 레디언스 필드의 엔드 투 엔드 훈련을 가능하게 하기 위해.
제안 방법
- 입력 이미지에서 직접 추출한 국소 특징에 조건부인 픽셀 정렬 레디언스 필드를 제안하여 암묵적인 3D 표현을 조절한다.
- 각 입력 이미지에서 국소 세부 정보를 유지하는 픽셀 정렬 특징을 추출하기 위해 얕은 인코더-디코더 네트워크를 사용한다.
- 다중 시점 특징 통합의 일관성을 확보하기 위해 카메라 자세 정보를 특징 표현에 통합한다.
- 학습 가능한 풀링 메커니즘을 통해 카메라 인식 특징 요약을 적용하여, 공간 정렬을 유지하면서 시점 간 특징을 통합한다.
- 조건부 특징을 사용하여 예측된 레디언스 필드에서 볼륨 렌더링을 수행하여 새로운 시점을 합성한다.
- 3D 감독이나 명시적 기하 구조 애너테이션 없이도 사진 재투영 손실만을 사용하여 전체 모델을 엔드 투 엔드로 훈련한다.
실험 결과
연구 질문
- RQ1국소적이고 픽셀 정렬된 특징에 조건부인 신경 레디언스 필드가 신원 일반화가 가능한 3D 아바타 생성에 효과적으로 기여할 수 있는가?
- RQ2전역 잠재 코드 대신 국소 특징을 사용함으로써 헤어와 표정과 같은 세부 정보의 모델링이 향상되는가?
- RQ3소수의 입력 이미지에 조건부로 설정된 상태에서 재학습 없이도 새로운 신원과 표정에 일반화 가능한가?
- RQ4카메라 자세 정보의 통합이 합성된 시점의 품질과 일관성에 어떤 영향을 미치는가?
- RQ5특징 추출기와 특징 요약 전략의 선택이 재구성 정밀도에 얼마나 큰 영향을 미치는가?
주요 결과
- PVA는 cNeRF 및 eNeRF와 같은 최근 기술들과 비교해도 새로운 시점 합성 품질에서 최신 기술 수준을 달성한다.
- 전역 잠재 코드에 의존하는 모델들과는 달리, 새로운 신원과 표정에 대해 효과적으로 일반화된다.
- 단 두 장의 입력 시점만으로도 시점 외삽 시의 잡음이 크게 감소하여, 최소한의 입력으로도 강력한 일반화 능력을 보여준다.
- 카메라 인식 특징 요약은 단순 평균 풀링보다 더 높은 품질의 결과를 도출하여 줄무늬 무늬와 일관성 없는 현상을 감소시킨다.
- U-Net과 아워글라스 네트워크와 같은 깊은 아키텍처보다 얕은 인코더-디코더 특징 추출기가 국소 세부 정보를 더 잘 유지하여 성능이 뛰어나다.
- 훈련 중에 학습된 배경 모델링이 복잡한 조명 조건과 가림 영역에서 재구성 품질을 향상시킨다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.