[논문 리뷰] Animatable Implicit Neural Representations for Creating Realistic Avatars from Videos
이 논문은 캐논리컬 신경 레디언스 필드와 선형 블렌드 스킨닝 기반의 포즈 구동형 변형 필드를 조합하여 다중 시점 영상에서 애니메이션 가능한 3D 인간 아바타를 생성하는 새로운 프레임워크를 제안한다. 이 방법은 학습 가능한 블렌드 웨이트와 골격 운동을 사용하여 새로운 포즈에 대한 명시적 제어를 가능하게 하며, 특히 서피스 기반 기하 구조를 향상시키기 위해 서명 거리 필드를 활용하여 뷰 합성 및 3D 재구성에서 최신 기술 수준의 성능을 달성한다.
This paper addresses the challenge of reconstructing an animatable human model from a multi-view video. Some recent works have proposed to decompose a non-rigidly deforming scene into a canonical neural radiance field and a set of deformation fields that map observation-space points to the canonical space, thereby enabling them to learn the dynamic scene from images. However, they represent the deformation field as translational vector field or SE(3) field, which makes the optimization highly under-constrained. Moreover, these representations cannot be explicitly controlled by input motions. Instead, we introduce a pose-driven deformation field based on the linear blend skinning algorithm, which combines the blend weight field and the 3D human skeleton to produce observation-to-canonical correspondences. Since 3D human skeletons are more observable, they can regularize the learning of the deformation field. Moreover, the pose-driven deformation field can be controlled by input skeletal motions to generate new deformation fields to animate the canonical human model. Experiments show that our approach significantly outperforms recent human modeling methods. The code is available at https://zju3dv.github.io/animatable_nerf/.
연구 동기 및 목표
- 다중 시점 영상에서 직접 재구성함으로써 애니메이션 가능한 3D 인간 모델을 생성하는 데 드는 비용과 복잡성을 줄이기.
- 운동하는 NeRF의 과소약속 최적화 문제를 해결하기 위해 골격 사전 지식을 갖춘 포즈 구동형 변형 필드를 도입하기.
- 입력 골격 운동을 사용하여 재구성된 모델의 명시적 애니메이션을 가능하게 하여 벡터 또는 SE(3) 필드 표현 방식의 한계를 극복하기.
- 캔서널 공간에서 밀도 필드 대신 서명 거리 필드(SDF)를 탐색하여 기하 구조의 정밀도를 향상시키기.
제안 방법
- 이 방법은 운동하는 인간을 캐논리컬 신경 레디언스 필드와 관측 공간 점을 캐논리컬 공간으로 매핑하는 포즈 구동형 변형 필드로 분해한다.
- 변형 필드는 블렌드 웨이트를 3D 점마다 학습 가능한 신경 필드로 모델링하여 복잡한 변형을 포괄하는 선형 블렌드 스킨닝 기반으로 구축된다.
- 캐논리컬 신경 필드는 밀도/색상 필드 또는 서명 거리 필드(SDF)로 표현되며, SDF는 더 나은 기하 구조 정규화를 제공한다.
- 모델은 다중 시점 영상 시퀀스에서 볼륨 렌더링을 사용하여 엔드 투 엔드로 훈련되며, 골격 포즈가 변형 학습의 정규화를 위해 감독 신호로 사용된다.
- 대안적 접근으로, 포즈에 의존하는 이동 필드를 사용하여 관절 운동과 비강성 천의 변형을 분리한다.
- 학습된 변형 필드에 새로운 골격 포즈를 적용하여 신규 뷰 합성 및 신규 운동 애니메이션을 지원한다.
실험 결과
연구 질문
- RQ1선형 블렌드 스킨닝 기반의 포즈 구동형 변형 필드는 인간 모델링을 위한 동적 NeRF의 제어성과 정규화에 기여하는가?
- RQ2애니메이션 가능한 인간 아바타의 기하 재구성 품질 측면에서 서명 거리 필드(SDF)와 밀도 필드의 성능를 비교하면 어떻게 되는가?
- RQ3단일 시점 또는 다중 시점 영상 시퀀스가 복잡한 인간 운동의 고품질 재구성과 애니메이션을 얼마나 잘 가능하게 하는가?
- RQ4비강성 변형이 두드러지는 느슨한 옷을 입은 연기자에 대해서도 이 방법이 일반화 가능한가?
- RQ5훈련 프레임 수와 입력 시점의 수가 뷰 합성 및 재구성 성능에 어떤 영향을 미치는가?
주요 결과
- 이 방법은 Human3.6M, ZJU-MoCap, MonoCap, SyntheticHuman 데이터셋에서 영상 합성 성능에서 최신 기술 수준을 달성한다.
- 캐논리컬 표현에 서명 거리 필드(SDF)를 사용할 경우 기하 재구성 품질이 크게 향상되며, 특히 합성 벤치마크에서 두드러진다.
- 150~300프레임으로 훈련된 모델이 최적의 성능을 보이며, 300프레임을 초과하면 수익 감소 현상이 나타난다.
- 단일 시점 환경에서도 양호한 렌더링 품질을 달성하여, 제한된 입력 시점에 대한 방법의 강건성을 입증한다.
- 800프레임으로 훈련된 모델은 S9 주제에서 PSNR 24.48과 SSIM 0.895를 기록하여 장기 시퀀스에서도 안정적인 성능을 보였다.
- 미세한 옷 주름을 포착하는 데는 한계가 있지만, 특히 타이트한 옷을 입은 경우 복잡한 운동 상황에서도 합리적인 인간 형태를 성공적으로 재구성한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.