[논문 리뷰] CAT3D: Create Anything in 3D with Multi-View Diffusion Models
CAT3D는 제한된 입력 뷰로부터 다수의 일관된 새로운 시점을 생성하는 다중 시점 확산 모델을 도입하여, 몇 장의 이미지나 심지어 한 장의 이미지 또는 텍스트 프롬프트로도 빠르고 높은 품질의 3D 장면 재구성을 가능하게 한다.
Advances in 3D reconstruction have enabled high-quality 3D capture, but require a user to collect hundreds to thousands of images to create a 3D scene. We present CAT3D, a method for creating anything in 3D by simulating this real-world capture process with a multi-view diffusion model. Given any number of input images and a set of target novel viewpoints, our model generates highly consistent novel views of a scene. These generated views can be used as input to robust 3D reconstruction techniques to produce 3D representations that can be rendered from any viewpoint in real-time. CAT3D can create entire 3D scenes in as little as one minute, and outperforms existing methods for single image and few-view 3D scene creation. See our project page for results and interactive demos at https://cat3d.github.io .
연구 동기 및 목표
- 일관된 새로운 시점을 생성하여 고품질 3D 장면 생성을 위한 필요한 입력 뷰의 수를 줄인다.
- 생성 우선 모듈을 3D 재구성 파이프라인에서 분리하여 효율성과 품질을 향상시킨다.
- 조밀하지 않은 뷰, 단일 이미지 또는 텍스트 프롬프트로부터 강건한 3D 재구성을 갖춘 3D 생성을 가능하게 한다.
제안 방법
- 입력 뷰와 카메라 포즈에 조건부로 작용하는 다중 시점 확산 모델을 훈련하여 다수의 대상 뷰를 생성한다.
- 공간-시간적 3D 자기 주의와 레이맵 카메라 조건화를 사용하여 한 이미지당 포즈를 확산 잠재 공간에 인코딩한다.
- 대상 시점을 그룹화하고 앵커 및 후속 시점 그룹을 자기회귀적으로 샘플링하여 대규모 뷰 세트를 생성한다.
- 뷰 불일치를 처리하기 위해 LPIPS 등의 지각 손실과 거리 가중 뷰 기여를 포함한 Zip-NeRF 기반의 강력한 3D 재구성 단계와 통합한다.
- 사전 학습된 잠재 확산 모델에서 미세 조정하고, 로그(N)에 비례하는 잡음 스케줄 이동을 적용하여 더 많은 대상 뷰를 수용한다.
- 가장 가까운 뷰 전략으로 조건부를 처리하고, 정사각형으로 잘라내고 패딩된 입력을 통해 넓은 종횡비를 관리한다.
실험 결과
연구 질문
- RQ1하나 이상의 입력 뷰에 조건부인 다중 시점 확산 모델이 대규모의 일관된 새로운 시점을 생성하여 정확한 3D 재구성에 적합한가?
- RQ2생성과 3D 재구성을 분리하는 것이 몇 뷰 및 단일 이미지 3D 생성의 효율성과 품질을 향상시키는가?
- RQ3조건화 선택(레이맵, 3D 자기 주의, 조건 뷰의 수)이 시점 일관성과 최종 3D 품질에 어떤 영향을 미치는가?
- RQ4이전 연구와 비교하여 희소 다중 뷰, 소수 뷰, 단일 이미지에서의 CAT3D 성능은 어떠한가?
- RQ5생성된 시점으로부터의 3D 재구성과 실제 사진으로부터의 재구성에서의 한계점 및 실패 모드는 무엇인가?
주요 결과
- CAT3D는 여러 데이터셋에 걸친 여러 개의 소수 뷰 3D 재구성 벤치마크에서 최첨단 성능을 달성한다.
- CAT3D는 생성 시간을 이전 메서드의 수 시간에서 몇 분으로 단축한다.
- 소수 뷰 환경에서 CAT3D는 RealEstate10K, LLFF, DTU, CO3D, mip-NeRF 360 데이터세트에서 PSNR, SSIM, LPIPS 측면에서 Zip-NeRF, ZeroNVS, ReconFusion을 능가한다.
- 단일 이미지에서의 3D 생성에 대해 CAT3D는 CLIP 기반 이미지 점수도 경쟁력 있게 제공하면서 상당한 속도 이점을 가진다(대략 1분 대 일부 baselines의 최대 120분).
- 특성 제거 연구는 3D 자기 주의, 레이맵 카메라 조건화, 다수의 출력을 공동으로 모델링하는 것이 이미지 품질과 3D 재구성을 모두 향상시킴을 보여준다.
- 이 방법은 보지 못한 영역에서도 타당한 내용을 유지하고 관찰된 영역의 기하를 보존하여, 많은 설정에서 여러 선행 방법을 능가한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.