Skip to main content
QUICK REVIEW

[论文解读] Moving in a 360 World: Synthesizing Panoramic Parallaxes from a Single Panorama

Ching-Yu Hsu, Cheng Sun|arXiv (Cornell University)|Jun 21, 2021
Advanced Vision and Imaging被引用 11
一句话总结

该论文提出 OmniNeRF,这是首个利用神经辐射场从单个 360° RGB-D 全景图合成具有视 parallax 效果的新全景视图的方法。通过在虚拟相机位置处在 3D 与 2D 全景坐标之间进行双向投影,该方法增强训练数据并实现在无需相机参数情况下的自由视角渲染,在合成数据集和真实世界数据集上均实现了高保真结果,Matterport3D 上的 PSNR 达到 33.94。

ABSTRACT

We present Omnidirectional Neural Radiance Fields (OmniNeRF), the first method to the application of parallax-enabled novel panoramic view synthesis. Recent works for novel view synthesis focus on perspective images with limited field-of-view and require sufficient pictures captured in a specific condition. Conversely, OmniNeRF can generate panorama images for unknown viewpoints given a single equirectangular image as training data. To this end, we propose to augment the single RGB-D panorama by projecting back and forth between a 3D world and different 2D panoramic coordinates at different virtual camera positions. By doing so, we are able to optimize an Omnidirectional Neural Radiance Field with visible pixels collecting from omnidirectional viewing angles at a fixed center for the estimation of new viewing angles from varying camera positions. As a result, the proposed OmniNeRF achieves convincing renderings of novel panoramic views that exhibit the parallax effect. We showcase the effectiveness of each of our proposals on both synthetic and real-world datasets.

研究动机与目标

  • 从单个 360° RGB-D 全景图实现具有视差效果的新全景视图合成,克服传统多视角方法的局限性。
  • 通过利用单个全向输入及深度信息,消除对多张图像和相机参数的需求。
  • 通过 3D-2D 重投影生成合成多视角训练样本,解决单输入导致的训练数据不足问题。
  • 通过基于梯度的监督和对重投影视图中不完整或遮挡区域的鲁棒处理,提升渲染质量。
  • 证明仅从一张全景图像学习完整 3D 场景表示(通过隐式神经场)的可行性。

提出的方法

  • 通过将相机中心平移到虚拟位置,并将 3D 点重新投影回 2D 图像空间,对单个 RGB-D 全景图进行增强,以生成合成训练视图。
  • 使用多层感知机(MLP)将场景表示为连续函数,将 5D 坐标(x, y, z, θ, ϕ)映射到颜色和密度,从而实现自由视角渲染。
  • 利用深度图和从中心出发的单位向量将 2D 图像坐标投影到 3D 空间,实现在无需相机参数估计情况下的一致光线追踪。
  • 通过双向 3D 到 2D 和 2D 到 3D 投影模拟多个视角,同时处理因遮挡或分辨率限制导致的缺失像素。
  • 利用基于像素的 NeRF 表示,仅在训练期间关注有效可见像素,从而减少不完整投影带来的伪影。
  • 引入辅助梯度损失,以提升合成全景图的结构一致性和细节质量。

实验结果

研究问题

  • RQ1能否使用单个 360° RGB-D 全景图合成具有真实感视差效果的新全景视图?
  • RQ2如何从单个输入全景图有效增强训练数据,以支持鲁棒的神经辐射场学习?
  • RQ3在复杂场景中,基于单张全景图训练的神经辐射场在新相机位置上的泛化能力如何?
  • RQ4基于梯度的监督是否能提升合成全景图的保真度和结构准确性?
  • RQ5OmniNeRF 是否能在无需相机参数或多张输入图像的情况下实现照片级真实感渲染?

主要发现

  • 在 Structured3D 数据集上,OmniNeRF 的 PSNR 达到 33.147,显著优于在相同单输入上训练的基线 NeRF 模型(22.459)。
  • 在 Matterport3D 数据集上,OmniNeRF 在梯度监督下 PSNR 达到 33.943,而基线 NeRF 仅为 17.269,表明其在真实室内场景中具有强大的泛化能力。
  • 在户外的 Google Street View 数据集上,OmniNeRF 在梯度损失下 PSNR 达到 33.766,表明其在复杂户外环境中的优异表现。
  • 引入梯度损失后,SSIM 提升且 LPIPS 降低,表明合成视图的结构保留性与感知质量更优。
  • 定性结果表明,OmniNeRF 即使在复杂几何结构的场景中,也能沿水平路径生成合理的新视图,但在高度遮挡或不规则结构中性能有所下降。
  • 该方法可实现类似飞行穿越的渲染效果,如补充视频所示,证实其具备沉浸式 360° 场景探索能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。