[논문 리뷰] Animatable Neural Radiance Fields from Monocular RGB Video
이 논문은 포즈 유도 변형과 학습 중 포즈 추정 개선을 통해 캐논리컬 공간을 학습하여 단일 RGB 영상에서 고해상도 인간 아바타를 생성하기 위한 애니메이터블 신경 레디언스 필드를 제안한다. 이 방법은 다양한 포즈에서 사진 수준의 정확도를 갖는 시각 일致성 렌더링과 세밀한 인간 성능의 애니메이션을 가능하게 한다.
We present animatable neural radiance fields for detailed human avatar creation from monocular videos. Our approach extends neural radiance fields (NeRF) to the dynamic scenes with human movements via introducing explicit pose-guided deformation while learning the scene representation network. In particular, we estimate the human pose for each frame and learn a constant canonical space for the detailed human template, which enables natural shape deformation from the observation space to the canonical space under the explicit control of the pose parameters. To compensate for inaccurate pose estimation, we introduce the pose refinement strategy that updates the initial pose during the learning process, which not only helps to learn more accurate human reconstruction but also accelerates the convergence. In experiments we show that the proposed approach achieves 1) implicit human geometry and appearance reconstruction with high-quality details, 2) photo-realistic rendering of the human from arbitrary views, and 3) animation of the human with arbitrary poses.
연구 동기 및 목표
- 단일 RGB 영상 스트림으로부터 세밀하고 사진 수준의 인간 아바타 재구성을 가능하게 하기 위해.
- 다양한 인간 기하학과 외관 모델링 문제를 다루기 위해 다중 시점 감독 없이 신경 레디언스 필드에서 해결하기 위해.
- 학습된 캐논리컬 공간을 사용하여 임의의 포즈로 인간의 제어 가능한 애니메이션을 구현하기 위해.
- 최적화 중 초기 포즈 추정치를 개선하여 재구성 정확도와 학습 수렴 속도를 향상시키기 위해.
제안 방법
- 이 방법은 관측 공간에서 캐논리컬 공간으로의 명시적 포즈 유도 변형을 가능하게 하기 위해 인간 템플릿을 위한 캐논리컬 공간을 도입한다.
- 각 프레임에 대해 인간 포즈를 추정하고, 이러한 파rameter를 신경 레디언스 필드 네트워크 내의 변형을 유도하는 데 사용한다.
- 초기 포즈 추정치를 학습 중에 업데이트하여 정확도를 보정하고 재구성 품질을 향상시키는 포즈 정밀화 전략을 도입한다.
- 장면 표현 네트워크는 캐논리컬 공간에서 기하학과 외관을 학습하여 다양한 포즈에서 세부 사항을 유지한다.
- 이 접근법은 암묵적 신경 표현을 활용하여 단일 시점 입력에서 복잡한 인간 형태와 질감을 모델링한다.
실험 결과
연구 질문
- RQ1단일 RGB 영상만을 사용하여 신경 레디언스 필드를 다이나믹한 인간 시나리오로 확장할 수 있는가?
- RQ2다중 시점 감독 없이 단일 영상 스트림으로부터 정확한 인간 기하학과 외관을 재구성할 수 있는가?
- RQ3캐논리컬 공간 내의 포즈 유도 변형이 임의의 포즈로 고해상도의 애니메이션을 가능하게 할 수 있는가?
- RQ4학습 중 포즈 정밀화가 재구성 품질과 수렴 속도에 얼마나 기여하는가?
주요 결과
- 이 방법은 다중 시점 감독 없이도 단일 영상에서 세밀한 디테일을 갖는 인간 기하학과 외관의 고품질 암묵적 재구성을 달성한다.
- 어려운 조명 조건과 포즈 조건에서도 임의의 새로운 시점에서 사진 수준의 인간 아바타 렌더링을 구현한다.
- 입력 영상에 존재하지 않는 포즈를 포함하여도 자연스러운 인간 아바타 애니메이션을 가능하게 한다.
- 고정된 포즈 입력에 비해 학습 중 포즈 정밀화가 재구성 정확도를 향상시키고 수렴 속도를 가속화한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.