[논문 리뷰] Generalizable Neural Performer: Learning Robust Radiance Fields for Human Novel View Synthesis
이 논문은 Generalizable Neural Performer (GNR)를 소개합니다. 이는 희소 시점 뷰에서의 자유 시점 인간 합성을 위한 일반화 가능한 암시적 방사장 필드 프레임워크로, 암시적 기하학적 바디 임베딩과 화면 공간 차폐 인식 appearance 블렌딩을 결합하여 케이스별 파인 튜닝 없이도 교차 피사체 및 교차 자세 렌더링의 강건함을 달성합니다. 또한 강건한 평가를 위한 GeneBody-1.0 데이터셋도 제시합니다.
This work targets at using a general deep learning framework to synthesize free-viewpoint images of arbitrary human performers, only requiring a sparse number of camera views as inputs and skirting per-case fine-tuning. The large variation of geometry and appearance, caused by articulated body poses, shapes and clothing types, are the key bottlenecks of this task. To overcome these challenges, we present a simple yet powerful framework, named Generalizable Neural Performer (GNR), that learns a generalizable and robust neural body representation over various geometry and appearance. Specifically, we compress the light fields for novel view human rendering as conditional implicit neural radiance fields from both geometry and appearance aspects. We first introduce an Implicit Geometric Body Embedding strategy to enhance the robustness based on both parametric 3D human body model and multi-view images hints. We further propose a Screen-Space Occlusion-Aware Appearance Blending technique to preserve the high-quality appearance, through interpolating source view appearance to the radiance fields with a relax but approximate geometric guidance. To evaluate our method, we present our ongoing effort of constructing a dataset with remarkable complexity and diversity. The dataset GeneBody-1.0, includes over 360M frames of 370 subjects under multi-view cameras capturing, performing a large variety of pose actions, along with diverse body shapes, clothing, accessories and hairdos. Experiments on GeneBody-1.0 and ZJU-Mocap show better robustness of our methods than recent state-of-the-art generalizable methods among all cross-dataset, unseen subjects and unseen poses settings. We also demonstrate the competitiveness of our model compared with cutting-edge case-specific ones. Dataset, code and model will be made publicly available.
연구 동기 및 목표
- 희소 다중 뷰 입력으로 특정 케이스 파인 튜닝 없이 임의의 인간 수행자의 자유 시점 이미지를 합성하는 도전을 해결한다.
- 자세, 형상, 의복 변화를 처리할 수 있는 강건하고 일반화 가능한 신경 바디 표현을 개발한다.
- 기하학적 사전 지식과 소스 뷰의 appearance 큐를 도입하여 뷰 간 기하학 정확도와 외형 리얼리즘을 개선한다.
- 일반화 가능한 인간 렌더링을 벤치마크하기 위한 다양한 다중 뷰 데이터셋(GeneBody-1.0)을 제공한다.
제안 방법
- 신경 복사 광선장에 SMPLx 기반 기하학 및 다중 뷰 큐를 조건으로 하는 Implicit Geometric Body Embedding을 도입한다.
- SMPLx 표면 기반의 부호화된 음의 거리 함수(SDF)와 표준 공간의 의미 임베딩을 결합하여 바디 기하를 고정한다.
- 다중 뷰 이미지 특징을 바디 임베딩과 융합하여 조건부 NeRF 프레임워크에서 복사 광선장을 정보화한다.
- Screen-Space Occlusion-Aware Appearance Blending (SSOA-AB)를 제안하여 블렌딩을 차폐 맵과 시점 주의 기반 블렌딩으로 분해하고, 소스 뷰 텍스처가 복사 광선 예측을 보정하도록 하면서 관찰되지 않는 영역에서 고스트를 완화한다.
- 볼륨 렌더링이 가능한 조건부 NeRF를 통해 렌더링하고, 3D 그라운드 트 truth가 있을 때 점유(occupancy) 및 차폐(supervision)를 포함한 광학적 및 기하학적 손실로 학습한다.
- GeneBody-1.0 및 ZJU-Mocap에서 학습·평가하고 일반화 기준선(pixelNerf, IBRNet)과 케이스별 방법(NeuralBody, NeuralTexture, NHR, NeuralVolumes)과 비교한다.
실험 결과
연구 질문
- RQ1하나의 모델이 일반화 가능하고 강건한 암시적 바디 표현을 학습하여 특정 피사체 조정 없이 임의의 인간 수행자의 새로운 관점을 고품질로 합성할 수 있는가?
- RQ2기하학적 사전 지식과 다중 뷰 소스 힌트를 어떻게 통합하여 자세와 의복 변 variation에 대한 강건성을 개선할 수 있는가?
- RQ3화면 공간 차폐 인식 블렌딩이 고스트 제거된 외형과 sparse 입력 하의 다중 뷰 일관성을 가능하게 하는가?
- RQ4제안된 방법이 보지 않은 피사체와 보지 않은 자세에서 최신 일반화 및 케이스별 접근법과 비교하여 어떠한 성능을 보이는가?
주요 결과
- GNR은 GeneBody-1.0 및 ZJU-Mocap에서 보지 않은 ID와 보지 않은 자세에 대해 일반화 기반선과 비교하여 렌더링 품질이 선도적이다.
- GNR은 도전적인 의복이나 자세에서도 강건한 기하 정합성과 고품질 외형을 보여, 다수의 최첨단 방법들보다 우수한 성능을 보인다.
- 고찰 연구에서 암시적 바디 임베딩, 주의 기반 외형 블렌딩, 화면 공간 차폐 인식 블렌딩 각각이 기하, 렌더링 및 외형 충실도 개선에 기여한다.
- 합성 RenderPeople 데이터에서 GNR은 baselines에 비해 3D 기하 재구성(Chamfer 거리 감소)과 고품질 이미지(PSNR/SSIM)가 강력하다.
- GeneBody-1.0 데이터셋은 다양 한 피사체, 자세, 의복을 제공하여 실제와 유사한 시나리오에서 일반화 가능한 인간 렌더링을 벤치마크한다.
- 바디 임베딩이 없거나, 주의가 없거나, 차폐 인식 블렌딩이 없으면 성능이 저하되어 각 구성요소의 가치가 강조된다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.