Skip to main content
QUICK REVIEW

[논문 리뷰] GaussianAvatars: Photorealistic Head Avatars with Rigged 3D Gaussians

Shenhan Qian, Tobias Kirschstein|arXiv (Cornell University)|2023. 12. 04.
Face recognition and analysis인용 수 5
한 줄 요약

GaussianAvatars는 3D 가우시안 스플래터를 매개변수화된 모형화된 얼굴 모델(FLAME)에 고정시켜 표정, 자세, 시점에 대한 완전한 제어가 가능한 사진처럼 생생한 헤드 애벌러를 생성하는 방법을 제안한다. 바인딩 상속을 통해 FLAME 매개변수와 가우시안 스플래터의 위치를 동시에 최적화함으로써, 최신 기술 대비 뛰어난 신규 시점 렲영 및 재연 품질을 달성한다.

ABSTRACT

We introduce GaussianAvatars, a new method to create photorealistic head avatars that are fully controllable in terms of expression, pose, and viewpoint. The core idea is a dynamic 3D representation based on 3D Gaussian splats that are rigged to a parametric morphable face model. This combination facilitates photorealistic rendering while allowing for precise animation control via the underlying parametric model, e.g., through expression transfer from a driving sequence or by manually changing the morphable model parameters. We parameterize each splat by a local coordinate frame of a triangle and optimize for explicit displacement offset to obtain a more accurate geometric representation. During avatar reconstruction, we jointly optimize for the morphable model parameters and Gaussian splat parameters in an end-to-end fashion. We demonstrate the animation capabilities of our photorealistic avatar in several challenging scenarios. For instance, we show reenactments from a driving video, where our method outperforms existing works by a significant margin.

연구 동기 및 목표

  • 표정, 자세, 시점에 대한 완전한 제어가 가능한 사진처럼 생생한 애니메이션 가능한 헤드 애벌러를 생성하는 것.
  • 동적 헤드 애벌러에서 고해상도의 새로운 시점 렌더링과 정밀한 애니메이션 제어를 동시에 달성하는 과제를 해결하는 것.
  • NeRF 및 3D 가우시안 스플래터링의 동적 장면 애니메이션에서의 한계를 극복하기 위해 매개변수화된 얼굴 모델을 통한 명시적 기하 제어를 통합하는 것.
  • 제약된 가우시안 스플래터 배치를 통해 새로운 표정과 자세를 구현하면서도 시각적 정확도를 유지할 수 있도록 하는 것.
  • 제어력을 잃지 않고도 동적으로 가우시안을 추가하거나 제거할 수 있도록 하는 바인딩 상속 전략을 개발하는 것.

제안 방법

  • 방법은 FLAME 메시의 각 삼각형 중심에 3D 가우시안 스플래터를 초기화하며, 각 스플래터는 부모 삼각형의 운동에 따라 강체 변환된다.
  • 동적 추가 및 제거가 가능하면서도 기반 매개변수화 모델의 제어력을 유지할 수 있도록 바인딩 상속 전략을 도입한다.
  • 기하학적 정확도와 외관의 정확성을 확보하기 위해 FLAME 매개변수와 가우시안 스플래터 매개변수(위치, 스케일, 색상)를 함께 최적화한다.
  • 가우시안 스플래터가 메시 표면 근처에 머무르도록 위치 손실를 제약하여, 새로운 얼굴 운동을 포함한 애니메이션 중에 잡음이 발생하는 것을 방지한다.
  • 작은 허용 오차를 가진 스케일 정규화를 통해 가우시안이 충분한 크기를 유지하여 투명 표면을 형성하고 음영 처리를 효과적으로 처리한다.
  • 재구성 과정 중에 엔드 투 엔드로 FLAME 매개변수를 정밀 조정함으로써 기하학적 정확도와 표정 충실도를 향상시킨다.

실험 결과

연구 질문

  • RQ13D 가우시안 스플래터를 매개변수화된 얼굴 모델에 효과적으로 고정시켜 제어 가능하고 사진처럼 생생한 애벌러 애니메이션을 가능하게 할 수 있는가?
  • RQ2가우시안 스플래터를 동적으로 추가하거나 제거할 때도 애니메이션 제어력과 기하학적 충실도를 유지할 수 있는가?
  • RQ3어떤 최적화 전략이 동적 헤드 애벌러에서 고해상도의 새로운 시점 렌더링과 정확한 표정 전달을 가능하게 하는가?
  • RQ4바인딩 상속 전략이 새로운 표정과 자세를 포함한 애니메이션에서 얼마나 강력한 성능을 발휘하는가?
  • RQ5FLAME와 가우시안 매개변수를 함께 최적화하는 것이 별도 최적화에 비해 시각적 품질과 제어력 측면에서 어떻게 우월한가?

주요 결과

  • GaussianAvatars는 새로운 시점 합성에서 PSNR 28.8과 SSIM 0.883을 달성하여 최신 기술 대비 두 지표에서 모두 슈퍼리어한 성능을 보였다.
  • 자기 재연 테스트에서는 PSNR 25.1과 SSIM 0.853을 기록했으며, 기준 기술 대비 감지 오차가 크게 낮아 보다 자연스러운 결과를 얻었다.
  • 제거 실험에서 바인딩 상속 기능을 비활성화하면 PSNR가 26.8로 떨어지며, 제어되지 않은 가우시안 스케일링과 분포로 인해 정확도가 급격히 떨어지는 것으로 확인되었다.
  • 스케일 정규화를 생략하면 이미지 품질이 약간 저하되지만, 허용 오차를 제거할 경우 PSNR가 25.0으로 급격히 떨어지며 제어된 스케일링의 필요성을 입증했다.
  • 위치 손실를 생략하면 최적의 학습 지표(PSNR 29.7)를 기록하지만 애니메이션 중 균열과 날아다니는 빛의 덩어리 같은 심각한 잡음이 발생함으로써, 일반화 능력 향상을 위해 위치 손실의 중요성을 입증했다.
  • FLAME 정밀 조정 기능을 비활성화할 경우 새로운 시점 합성에서 PSNR가 26.1로 떨어지고 재연 테스트에서 감지 오차가 증가하여 기하학적 정확도 향상에 기여한다는 점을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.