Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Compositional Radiance Fields of Dynamic Human Heads

Ziyan Wang, Timur Bagautdinov|arXiv (Cornell University)|2020. 12. 17.
3D Shape Modeling and Analysis참고 문헌 34인용 수 11
한 줄 요약

이 논문은 다중 시야 영상에서 동적인 인간의 머리에 대한 고해상도이고 시야 일致성 있는 이미지를 합성하기 위한 조합형 레이디언스 필드 프레임워크를 제안한다. 이는 3D 조건부 디코더와 정련 MLP를 갖춘 분리된 잠재 공간을 사용하여 시야에 따라 변하는 외관과 기하학을 모델링하며, 새로운 시퀀스에 대한 최소한의 피팅으로도 고품질의 새로운 시점 합성과 제어 가능한 표정 애니메이션을 달성한다.

ABSTRACT

Photorealistic rendering of dynamic humans is an important ability for telepresence systems, virtual shopping, synthetic data generation, and more. Recently, neural rendering methods, which combine techniques from computer graphics and machine learning, have created high-fidelity models of humans and objects. Some of these methods do not produce results with high-enough fidelity for driveable human models (Neural Volumes) whereas others have extremely long rendering times (NeRF). We propose a novel compositional 3D representation that combines the best of previous methods to produce both higher-resolution and faster results. Our representation bridges the gap between discrete and continuous volumetric representations by combining a coarse 3D-structure-aware grid of animation codes with a continuous learned scene function that maps every position and its corresponding local animation code to its view-dependent emitted radiance and local volume density. Differentiable volume rendering is employed to compute photo-realistic novel views of the human head and upper body as well as to train our novel representation end-to-end using only 2D supervision. In addition, we show that the learned dynamic radiance field can be used to synthesize novel unseen expressions based on a global animation code. Our approach achieves state-of-the-art results for synthesizing novel views of dynamic human heads and the upper body.

연구 동기 및 목표

  • 다중 시야 영상에서 동적인 인간의 머리에 대해 고해상도이고 시야 일치하는 새로운 시점 합성을 가능하게 한다.
  • 분리된 잠재 표현을 사용하여 동적인 얼굴 표정에서 복잡한 시야에 따라 변하는 외관과 기하학을 모델링한다.
  • 잠재 공간 샘플링과 관절점 기반 제어를 통해 제어 가능한 애니메이션을 지원한다.
  • 특히 인코더 전용 피팅을 통해 새로운 머리 시퀀스에 빠르게 적응할 수 있도록 한다.
  • 표현과 시점 변화에 대해 세밀한 제어가 가능한 현실적인 렌더링을 달성한다.

제안 방법

  • 2D 이미지 인코더가 평균과 분산을 갖는 256차원 잠재 벡터로 입력 이미지를 회귀시켜 분리된 표현 학습을 가능하게 한다.
  • 3D 조건부 디코더는 역방향 3D 컨벌루션을 사용하여 잠재 코드에서 거시적 수준의 로그 투명도, 색상, 공간 특징을 생성한다.
  • 정련 MLP는 3D 좌표와 공간 특징을 입력으로 받아 세밀한 투명도와 색상을 예측하며, 카메라 방향과 시점별 특징을 통해 시야에 따라 변하는 특징을 통합한다.
  • 3D 좌표에 위치 인코딩을 적용하여 유도적 편향을 향상시키고 정련 네트워크에서 세밀한 디테일 모델링을 가능하게 한다.
  • 128개의 거시적 쿼리 포인트와 레이당 32개의 세밀한 쿼리 포인트를 갖는 다단계 샘플링 기반의 설계를 사용하며, 색상, 투명도, KL 정규화를 포함한 다손실 목적함수로 훈련된다.
  • 모델은 PointNet 방식의 관절점 인코더를 통해 2D 관절점 시퀀스와 같은 대체 입력 모odalities를 지원하며, 이는 잠재 공간으로의 회귀를 가능하게 한다.

실험 결과

연구 질문

  • RQ1조합형 레이디언스 필드 모델은 시야에 따라 변하는 외관 효과를 고려하여 동적인 인간의 머리에 대해 고해상도의 새로운 시점 합성을 달성할 수 있는가?
  • RQ2분리된 잠재 공간 표현은 제어 가능한 표정 애니메이션과 보간에 얼마나 잘 기여하는가?
  • RQ3최소한의 피팅으로 새로운 머리 정체성에 얼마나 잘 일반화되는가?
  • RQ4관절점 기반 제어는 신경 레이디언스 필드에 효과적으로 통합될 수 있는가?
  • RQ5거시적 및 세밀한 네트워크 단계의 조합은 어떤 방식으로 렌더링 품질과 디테일 충실도를 향상시키는가?

주요 결과

  • 모델은 현실적인 시야에 따라 변하는 외관과 일관된 기하학을 갖춘 동적인 인간의 머리에 대해 고해상도의 새로운 시점 합성을 달성한다.
  • 잠재 공간 샘플링을 통해 부드러운 표정 보간이 가능하며, 추가 학습 없이도 자연스러운 전환을 생성한다.
  • 새로운 시퀀스에 대해 인코더 전용 피팅을 통해 빠른 적응이 가능하며, 비피팅 기반 베이스라인에 비해 렌더링 품질이 크게 향상된다.
  • 모델은 새로운 시퀀스로의 일반화가 잘 되어 있으며, 피팅된 모델은 제로샷 베이스라인에 비해 더 매끄럽고 정확한 결과를 생성한다.
  • 2D 관절점 인코더를 사용한 관절점 기반 애니메이션은 성공적으로 달성되었으며, 이는 모델이 다양한 입력 모달리티를 수용하는 유연성을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.