[论文解读] PanoDiffusion: 360-degree Panorama Outpainting via Diffusion
PanoDiffusion 提出了一种新颖的双模态潜在扩散模型,通过在训练过程中同时利用 RGB 和深度全景图,从部分可见的 RGB 输入生成高质量、多样化且环绕一致的 360° 室内 RGB-D 全景图。通过在去噪过程中引入渐进式相机旋转以及双端对齐机制,该方法实现了最先进的性能,显著提升了结构一致性和对深度输入变化的鲁棒性。
Generating complete 360-degree panoramas from narrow field of view images is ongoing research as omnidirectional RGB data is not readily available. Existing GAN-based approaches face some barriers to achieving higher quality output, and have poor generalization performance over different mask types. In this paper, we present our 360-degree indoor RGB-D panorama outpainting model using latent diffusion models (LDM), called PanoDiffusion. We introduce a new bi-modal latent diffusion structure that utilizes both RGB and depth panoramic data during training, which works surprisingly well to outpaint depth-free RGB images during inference. We further propose a novel technique of introducing progressive camera rotations during each diffusion denoising step, which leads to substantial improvement in achieving panorama wraparound consistency. Results show that our PanoDiffusion not only significantly outperforms state-of-the-art methods on RGB-D panorama outpainting by producing diverse well-structured results for different types of masks, but can also synthesize high-quality depth panoramas to provide realistic 3D indoor models.
研究动机与目标
- 解决从存在缺失区域的窄视角(NFoV)RGB 图像中生成逼真、多样化且结构一致的 360° 室内全景图的挑战。
- 通过采用稳定的潜在扩散框架,克服基于 GAN 的方法存在的模式崩溃和训练不稳定等局限。
- 通过在训练过程中整合深度信息,即使在推理阶段无深度输入,也提升全景图外补绘的质量。
- 确保生成全景图的环绕一致性,即由于 360° 图像的圆柱形特性,左右两端必须无缝对齐。
- 实现 RGB 和深度图的同步高保真度合成,以支持逼真的室内三维场景重建。
提出的方法
- 提出一种双模态潜在扩散模型,在训练期间联合依赖 RGB 和深度全景特征,使网络能够学习空间布局与物体结构。
- 在每个去噪步骤中引入渐进式相机旋转,使模型学习在不同旋转视角下生成一致的内容,从而增强全局一致性。
- 在每个去噪步骤中应用双端对齐机制,显式最小化输出全景图最左端与最右端区域之间的差异。
- 在 Structured3D 数据集上进行训练,使用掩码 RGB 输入和对应的深度图,推理阶段无需深度输入。
- 在推理阶段,仅使用部分可见的 RGB 图像作为输入,模型通过一次前向传播即可生成完整的 RGB 和深度全景图。
- 该架构采用潜在扩散与交叉注意力机制,以同时关注 RGB 和深度特征,实现外观与几何信息的联合建模。
实验结果
研究问题
- RQ1潜在扩散模型能否在推理阶段无需深度输入的情况下,有效从不完整的 RGB 输入中生成多样化且逼真的 360° RGB-D 全景图?
- RQ2在训练阶段引入深度监督在多大程度上提升了外补全景图的质量与结构一致性?
- RQ3在去噪过程中引入渐进式相机旋转,在多大程度上增强了生成全景图的环绕一致性?
- RQ4与现有方法相比,该模型在推理阶段面对不同程度的深度输入可见性变化时,其鲁棒性如何?
- RQ5该模型能否同时生成高质量的深度图,表明其已从仅 RGB 输入中有效学习了三维场景几何结构?
主要发现
- PanoDiffusion 在 Structured3D 数据集上达到最先进性能,无论在 RGB 还是深度合成方面,均优于 SOTA 方法如 BIPS 和 OmniDreamer,且在所有掩码类型下表现更优。
- 即使在训练阶段仅使用 50% 的稀疏深度输入,PanoDiffusion 生成的 RGB 外补绘结果仍优于使用完整深度训练的标准 LDM。
- 该模型对推理阶段深度输入的稀疏性具有强鲁棒性:性能保持稳定且显著优于 BIPS,后者在深度可见性降低时性能急剧下降。
- PanoDiffusion 的双端对齐机制将左右一致性误差(LRCE)降低至 85.04(随机框形掩码),显著低于 BIPS(148.78)和 OmniDreamer(136.68)。
- 该模型生成了准确的深度图,在表 2(c) 的大多数指标上表现最佳,表明其具备有效的三维布局理解能力。
- 出人意料的是,测试时若提供完全可见的深度输入,性能反而略有下降,表明模型已学会在模态不平衡条件下泛化,且不过度依赖深度信息。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。