Skip to main content
QUICK REVIEW

[논문 리뷰] DiffRF: Rendering-Guided 3D Radiance Field Diffusion

Norman Müller, Yawar Siddiqui|arXiv (Cornell University)|2022. 12. 02.
Computer Graphics and Visualization Techniques인용 수 6
한 줄 요약

DiffRF는 직접적인 3D 레디언스 필드 합성을 위한 첫 번째 확산 모델을 소개한다. 3D 노이즈 제거 U-Net을 볼록 격자에 적용하고 체적 렌더링 손실을 통해 다중 시점 일致성 우선 사전을 학습한다. 이는 고해상도, 시점 일致성 있는 3D 생성과 작업별 특화 훈련 없이도 새로운 마스크 처리를 가능하게 하며, FID(15.95 vs. 16.54)와 MMD(4.42 vs. 5.62)에서 GAN보다 뛰어난 성능을 보인다.

ABSTRACT

We introduce DiffRF, a novel approach for 3D radiance field synthesis based on denoising diffusion probabilistic models. While existing diffusion-based methods operate on images, latent codes, or point cloud data, we are the first to directly generate volumetric radiance fields. To this end, we propose a 3D denoising model which directly operates on an explicit voxel grid representation. However, as radiance fields generated from a set of posed images can be ambiguous and contain artifacts, obtaining ground truth radiance field samples is non-trivial. We address this challenge by pairing the denoising formulation with a rendering loss, enabling our model to learn a deviated prior that favours good image quality instead of trying to replicate fitting errors like floating artifacts. In contrast to 2D-diffusion models, our model learns multi-view consistent priors, enabling free-view synthesis and accurate shape generation. Compared to 3D GANs, our diffusion-based approach naturally enables conditional generation such as masked completion or single-view 3D synthesis at inference time.

연구 동기 및 목표

  • 포즈가 조절된 2D 이미지에서 직접 3D 레디언스 필드를 합성하는 생성 모델을 개발함으로써 고해상도 3D 자산 생성을 가능하게 한다.
  • 모호하고 잡음이 많은 레디언스 필드 감독 문제를 해결하기 위해 렌더링 유도 노이즈 제거 손실을 도입한다.
  • 작업별 특화 미세조정 없이도 마스크 처리 및 단일 시점 3D 합성과 같은 조건부 3D 생성 작업을 가능하게 한다.
  • 자유 시점 합성과 정확한 기하 구조 복원을 지원하는 다중 시점 일치 우선 사전을 학습한다.
  • 기준 데이터셋에서 기존 GAN 기반 방법보다 이미지 품질과 기하 정확도 측면에서 모두 뛰어난 성능을 달성한다.

제안 방법

  • 레디언스 필드의 명시적 볼록 격자 표현에 직접 작용하는 3D 노이즈 제거 확산 모델을 제안한다.
  • 노이즈 제거 과정이 고품질 이미지 합성 쪽으로 편향되도록 하여 잡음과 아티팩트의 피팅을 줄이는 렌더링 유도 손실을 도입한다.
  • 노이즈를 예측하기 위해 노이즈 제거 U-Net 아키텍처를 사용하며, 노이즈 스케줄 및 역확산 샘플링을 적용한다.
  • 학습 중에 다중 시점에서의 렌더링된 2D 이미지와 예측된 레디언스 필드를 일치시키기 위해 체적 렌더링 손실을 적용한다.
  • 분류기 가이던스를 통해 조건부 생성을 구현하며, 입력 이미지에 대한 렌더링 오차를 최소화하도록 노이즈 제거 과정을 이끌어낸다.
  • 마스크된 확산 과정을 통해 알려진 영역와 노이즈 제거 추정치를 반복적으로 융합함으로써 마스크된 레디언스 필드 복원을 수행한다: $ f_{0}^{t-1} = \sqrt{\bar{\alpha}_{t}}(m \odot \tilde{f}^{t}_{0} + (1-m) \odot f^{in}) $, 여기서 $ m $ 은 이진 마스크이다.
Figure 2 : For a time step $t$ uniformly sampled from ${1,...,T}$ , we first diffuse an initial radiance field $f_{0}$ according to a fixed noising schedule. The resulting $f_{t}$ is passed through a time-conditioned 3D-UNet, giving an estimate of the applied noise $\epsilon$ . We guide the model by
Figure 2 : For a time step $t$ uniformly sampled from ${1,...,T}$ , we first diffuse an initial radiance field $f_{0}$ according to a fixed noising schedule. The resulting $f_{t}$ is passed through a time-conditioned 3D-UNet, giving an estimate of the applied noise $\epsilon$ . We guide the model by

실험 결과

연구 질문

  • RQ1포즈가 조절된 2D 이미지에서 직접 3D 레디언스 필드를 합성하는 데 효과적으로 확산 모델을 훈련시킬 수 있는가? 중간 표현을 생략할 수 있는가?
  • RQ2렌더링 유도 손실은 아티팩트와 노이즈 피팅을 줄여서 생성된 레디언스 필드의 품질을 어떻게 향상시킬 수 있는가?
  • RQ3확산 기반 3D 생성은 자유 시점 합성과 정확한 기하 구조를 지원하는 다중 시점 일치 우선 사전을 학습할 수 있는가?
  • RQ4작업별 특화 미세조정 없이도 마스크된 레디언스 필드 복원과 같은 새로운 조건부 작업에 확산 프레임워크를 어떻게 적용할 수 있는가?
  • RQ5확산 기반 3D 레디언스 필드 모델은 기준 GAN 기반 방법과 비교해 이미지 품질과 기하 정확도 측면에서 어떻게 성능을 내는가?

주요 결과

  • DiffRF는 PhotoShape Chairs 데이터셋에서 Fréchet Inception Distance(FID)를 15.95로 기록하여 GAN 기반 EG3D 기준선(16.54)을 초월한다.
  • 모델은 Multi-scale Structural Similarity(MMD) 점수를 EG3D의 5.62에서 4.42로 낮춰 기하 정확도 향상을 나타낸다.
  • 마스크 처리 시 DiffRF는 EG3D보다 더 다양한 완성도 높은 복원 결과를 생성하며 원본 마스크 해제 영역을 더 잘 유지한다.
  • 정량적 평가에서 동일한 마스크 수준에서 DiffRF는 EG3D보다 마스크 해제 영역에서 더 높은 사진 품질 정확도(mPSNR)를 유지한다.
  • 포즈가 조절된 이미지와 배경 마스크를 사용해 분류기 가이던스를 통해 단일 시점 3D 합성을 가능하게 한다.
  • DiffRF는 지도 데이터 부족 문제를 렌더링 감시를 통해 극복하면서 3D 레디언스 필드에 직접 확산 모델을 훈련시키는 것이 가능함을 입증한다.
Figure 3 : Qualitative comparison between $\pi$ -GAN [ 7 ] , EG3D [ 8 ] , and our method on PhotoShape Chairs [ 46 ] . Our approach leads to diverse, geometrically accurate models that allow for high-quality renderings.
Figure 3 : Qualitative comparison between $\pi$ -GAN [ 7 ] , EG3D [ 8 ] , and our method on PhotoShape Chairs [ 46 ] . Our approach leads to diverse, geometrically accurate models that allow for high-quality renderings.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.