[论文解读] CAT3D: Create Anything in 3D with Multi-View Diffusion Models
CAT3D 引入多视角扩散模型,从有限输入视角生成大量一致的新视图,从而实现对场景的快速高质量3D重建,即使只有单张图像或文本提示也可
Advances in 3D reconstruction have enabled high-quality 3D capture, but require a user to collect hundreds to thousands of images to create a 3D scene. We present CAT3D, a method for creating anything in 3D by simulating this real-world capture process with a multi-view diffusion model. Given any number of input images and a set of target novel viewpoints, our model generates highly consistent novel views of a scene. These generated views can be used as input to robust 3D reconstruction techniques to produce 3D representations that can be rendered from any viewpoint in real-time. CAT3D can create entire 3D scenes in as little as one minute, and outperforms existing methods for single image and few-view 3D scene creation. See our project page for results and interactive demos at https://cat3d.github.io .
研究动机与目标
- 通过生成一致的新视图来减少高质量3D场景创建所需的输入视图数量。
- 将生成先验与3D重建管线解耦,以提升效率和质量。
- 能够从稀疏视图、单张图像或文本提示实现3D创建,并具备鲁棒的3D重建。
提出的方法
- 训练一个多视角扩散模型,在输入视图及其相机位姿的条件下生成多个目标视图。
- 使用3D自注意力(时空)和射线图相机条件对每张图像的位姿进行编码到扩散潜空间。
- 通过将目标视点分组并自回归地采样锚点和后续视图组,生成大量视图。
- 整合基于 Zip-NeRF 的鲁棒3D重建阶段,并结合感知损失(LPIPS)和距离权重视角贡献,以处理视角不一致。
- 从预训练的潜在扩散模型微调,并使用与 log(N) 成正比的噪声日程偏移,以容纳更多目标视图。
- 用最近视图策略处理条件,并通过方形裁剪和填充输入来管理宽纵横比。
实验结果
研究问题
- RQ1一个或多个输入视图条件下的多视角扩散模型是否能产生大量连贯的新视图,适合精确的3D重建?
- RQ2将生成与3D重建解耦是否能在少视图和单图像3D创建中提升效率和质量?
- RQ3条件选择(射线图、3D自注意力、条件视图数量)如何影响视图一致性和最终3D质量?
- RQ4在稀疏多视图、少视图和单图像到3D任务上,CAT3D 的性能相较于现有工作如何?
- RQ5从生成视图与真实照片重建3D场景时的局限性和失效模式有哪些?
主要发现
- CAT3D 在多个数据集的若干少视图3D重建基准上达到最新状态的性能。
- CAT3D 将生成时间从上小时级别缩短到几分钟。
- 在少视图设定下,CAT3D 在 RealEstate10K、LLFF、DTU、CO3D、以及 mip-NeRF 360 数据集上,在 PSNR、SSIM 和 LPIPS 方面超越 Zip-NeRF、ZeroNVS 和 ReconFusion。
- 对于从单张图像到3D创建,CAT3D 提供具有竞争力的 CLIP-based 图像分数,同时在速度上有显著优势(大约1分钟,而某些基线长达120分钟)。
- 消融研究表明,3D自注意力、射线图相机条件和联合建模多输出同时提升图像质量和3D重建。
- 该方法在未见区域保持合理内容,同时在已观测区域保持几何形态,在许多情境中优于多种现有方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。