Skip to main content
QUICK REVIEW

[论文解读] Extreme View Synthesis

Inchang Choi, Orazio Gallo|arXiv (Cornell University)|Dec 12, 2018
Advanced Vision and Imaging参考文献 35被引用 5
一句话总结

本文提出了一种名为极端视图合成(Extreme View Synthesis)的新方法,仅需两张输入图像即可生成高质量的新视角,即使在高达30倍基线外推的情况下也能实现。该方法通过利用深度概率体素来建模不确定性,并将其与基于图像块的可学习图像先验相结合,对扭曲后的视图进行精细化处理以减少伪影,从而在以往方法在极端条件下失效时仍能实现视觉上更优的结果。

ABSTRACT

We present Extreme View Synthesis, a solution for novel view extrapolation that works even when the number of input images is small--as few as two. In this context, occlusions and depth uncertainty are two of the most pressing issues, and worsen as the degree of extrapolation increases. We follow the traditional paradigm of performing depth-based warping and refinement, with a few key improvements. First, we estimate a depth probability volume, rather than just a single depth value for each pixel of the novel view. This allows us to leverage depth uncertainty in challenging regions, such as depth discontinuities. After using it to get an initial estimate of the novel view, we explicitly combine learned image priors and the depth uncertainty to synthesize a refined image with less artifacts. Our method is the first to show visually pleasing results for baseline magnifications of up to 30X.

研究动机与目标

  • 解决仅有两张输入图像且虚拟相机远离输入视角时的新视角合成挑战。
  • 减少在极端视图外推中由遮挡和深度不确定性引起的伪影。
  • 通过结合几何约束与可学习图像先验,提升极端视图合成中的图像质量。
  • 实现超越简单基线外推的自由相机运动(平移与旋转)。
  • 在现有方法因输入数据有限且外推程度过高而失效的情况下,仍能实现视觉上令人满意的输出。

提出的方法

  • 该方法为每个输入视角估计一个深度概率体素,而非单一深度值,以捕捉深度不确定性,从而更好地处理深度不连续性。
  • 通过扭曲和融合输入的深度概率体素,生成目标新视角的深度概率体素,以保留不确定性信息。
  • 利用新视角的深度概率体素,通过可微渲染生成初始新视角图像。
  • 采用基于图像块的细化网络对初始图像进行优化,通过深度概率分布引导,以改善局部结构并减少伪影。
  • 该细化网络通过根据深度不确定性采样图像块,同时利用全局图像先验与局部场景几何信息。
  • 该方法支持任意相机姿态,适用于插值与极端外推两种场景。

实验结果

研究问题

  • RQ1能否仅凭两张输入图像在极端基线外推条件下有效实现新视角合成?
  • RQ2如何利用深度不确定性来提升极端视图合成中的图像质量?
  • RQ3可学习图像先验能否与几何约束有效结合,以减少遮挡区域的伪影?
  • RQ4是否可能实现超越现有立体放大方法极限的高质量结果?
  • RQ5基于深度概率引导的图像块细化方法相比标准细化网络在重建质量上有哪些提升?

主要发现

  • 该方法在30倍基线放大条件下实现了视觉上令人满意的输出,这是该极端条件下文献中的首次成果。
  • 即使仅有两张输入图像,该方法在30倍外推条件下生成的图像仍比以往方法(如Stereo Magnification)更清晰、更连贯。
  • 基于图像块的细化网络显著优于无图像块引导的标准细化网络,尤其在重建遮挡区域方面表现更佳。
  • 该方法在多种相机运动下均保持高质量表现,包括对视图合成极具挑战性的推轨(dolly-in)轨迹。
  • 在YouTube获取的序列数据上,结果表现出强鲁棒性与泛化能力,证明了其在真实场景中仅用极少输入数据即可稳定工作。
  • 与基线方法(如Soft3D)相比,该方法在更少输入图像条件下实现了具有竞争力的性能,后者通常需要大量相机视角。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。