[논문 리뷰] DITTO-NeRF: Diffusion-based Iterative Text To Omni-directional 3D Model
DITTO-NeRF는 단일 이미지 또는 텍스트 프롬프트에서 고해상도이며 전방위적인 3D NeRF 모델을 생성하기 위해 확산 기반 반복적 방법을 제안한다. 이는 입사각(In-Boundary, IB)에서 외부각(Outer-Boundary, OB)으로 향하는 시야로 점진적으로 3D 객체를 복원함으로써 인painting 잠재 확산 모델과 점진적 정밀화를 사용한다. 이는 3D 생성 품질, 다양성 및 학습 속도에서 기존 방법들인 DreamFusion과 NeuralLift-360을 능가하는 최신 기술 수준(SOTA)의 성능을 달성한다.
The increasing demand for high-quality 3D content creation has motivated the development of automated methods for creating 3D object models from a single image and/or from a text prompt. However, the reconstructed 3D objects using state-of-the-art image-to-3D methods still exhibit low correspondence to the given image and low multi-view consistency. Recent state-of-the-art text-to-3D methods are also limited, yielding 3D samples with low diversity per prompt with long synthesis time. To address these challenges, we propose DITTO-NeRF, a novel pipeline to generate a high-quality 3D NeRF model from a text prompt or a single image. Our DITTO-NeRF consists of constructing high-quality partial 3D object for limited in-boundary (IB) angles using the given or text-generated 2D image from the frontal view and then iteratively reconstructing the remaining 3D NeRF using inpainting latent diffusion model. We propose progressive 3D object reconstruction schemes in terms of scales (low to high resolution), angles (IB angles initially to outer-boundary (OB) later), and masks (object to background boundary) in our DITTO-NeRF so that high-quality information on IB can be propagated into OB. Our DITTO-NeRF outperforms state-of-the-art methods in terms of fidelity and diversity qualitatively and quantitatively with much faster training times than prior arts on image/text-to-3D such as DreamFusion, and NeuralLift-360.
연구 동기 및 목표
- 기존의 이미지에서 3D로의 변환 방법에서 낮은 다중 시점 일致성과 입력 이미지에 대한 부정확한 대응 문제를 해결하기 위해.
- 현재의 텍스트에서 3D로의 생성 방법에서 제한된 다양성과 높은 계산 비용 문제를 극복하기 위해.
- 단일 이미지 또는 텍스트 프롬프트에서 효율적인 학습을 통해 고품질의 전방위적인 3D NeRF 생성을 가능하게 하기 위해.
- 입사각에서 외부각으로 향하는 고품질 정보를 반복적으로 전파하여 3D 재구성 정밀도를 향상시키기 위해.
- 시각적 품질과 구조적 일관성을 모두 향상시키는 확장 가능한 점진적 재구성 파이프라인을 개발하기 위해.
제안 방법
- 모노클러럴 깊이 추정과 정면 시점의 2D 이미지를 사용하여 입사각(IB) 각도에 대해 고품질의 부분적인 3D NeRF 모델을 구축한다.
- 외부각(OB) 각도에서 누락된 3D 영역을 반복적으로 재구성하기 위해 점수 분산 샘플링(SDS)을 적용한 인painting 잠재 확산 모델(LDM)을 사용한다.
- 진행형 글로벌 시야 샘플링(PGVS)은 학습 초반에 IB 각도를 우선순위로 하고 점차 OB 각도로 확장함으로써 재구성 안정성을 향상시킨다.
- 신뢰도 기반 마스킹을 적용하여 고신뢰도 IB 영역을 유지하면서 전체 3D 부피를 점진적으로 정밀화한다.
- 모든 IB 및 OB 영역에서 다중 척도 일致성 정밀화를 사용하여 격차를 최소화하고 기하학적 정밀도를 향상시킨다.
- 텍스트 프롬프트만 제공된 경우, 텍스트에서 이미지로의 확산 모델을 통합하여 다양한 2D 이미지 사전 지식을 생성한다.
실험 결과
연구 질문
- RQ1반복적 확산 기반 3D 생성은 이미지에서 3D로의 합성에서 다중 시점 일치성과 입력 이미지 대응을 향상시킬 수 있는가?
- RQ2진행형이고 시야 인지 샘플링 전략은 3D 재구성 품질과 학습 효율성을 향상시킬 수 있는가?
- RQ3잠재 확산 모델과 NeRF를 조합하면 텍스트나 단일 이미지에서 고해상도이며 다양한 3D 생성을 가능하게 하는가?
- RQ4신뢰도 기반 마스킹과 다중 척도 정밀화는 3D 객체의 일관성 향상과 아티팩트 감소에 어떤 영향을 미치는가?
- RQ5제안된 방법은 기존의 확산 기반 및 NeRF 기반 접근법과 비교해 3D 생성 품질과 학습 속도에서 최신 기술 수준(SOTA)의 성능을 달성할 수 있는가?
주요 결과
- 사용자 연구에서 DITTO-NeRF는 이미지에서 3D로의 생성 분야에서 최신 기술 수준(SOTA)의 방법들을 능가하며, 다중 시점 일치성과 소스 이미지 대응에서 뛰어난 성능을 보였다.
- 텍스트에서 3D로의 생성에서 DITTO-NeRF는 Stable-DreamFusion과 Latent-NeRF와 같은 기존 기술들보다 더 높은 출력 다양성과 정밀도를 달성했으며, 평균 평가 점수는 유의미한 향상을 보였다.
- NeuralLift-360과 DreamFusion에 비해 훨씬 빠른 학습 시간을 기록하여 더 효율적인 계산으로 고품질 결과를 도출했다.
- 절단 실험을 통해 차원 정밀화가 NeRF 렲영에서 저차원 잠재 투영으로 인한 잡음 아티팩트를 효과적으로 제거하는 데 성공했다.
- 진행형 글로벌 시야 샘플링(PGVS)은 이동 베타 및 이산 누적과 같은 대안적 샘플링 분포보다 우수한 성능을 보였으며, 정면 및 뒷면 시점 재구성에서 더 나은 결과를 얻었다.
- 신뢰도 기반 마스킹 전략은 고신뢰도 IB 영역의 유지에 기여하여 모든 시점에서 더 일관되고 안정적인 3D 재구성 결과를 이끌어냈다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.