[论文解读] Geometry-aware Deep Network for Single-Image Novel View Synthesis
本文提出了一种几何感知的深度神经网络,用于单图像新颖视图合成,通过使用固定数量的平面来建模场景,预测单应性矩阵和区域掩码以对输入图像进行变形,并利用可学习的选择图融合变形视图。该方法通过显式强制执行三维几何一致性,优于最先进的人工外观方法,在KITTI和ScanNet数据集上生成了更真实且结构更准确的新颖视图。
This paper tackles the problem of novel view synthesis from a single image. In particular, we target real-world scenes with rich geometric structure, a challenging task due to the large appearance variations of such scenes and the lack of simple 3D models to represent them. Modern, learning-based approaches mostly focus on appearance to synthesize novel views and thus tend to generate predictions that are inconsistent with the underlying scene structure. By contrast, in this paper, we propose to exploit the 3D geometry of the scene to synthesize a novel view. Specifically, we approximate a real-world scene by a fixed number of planes, and learn to predict a set of homographies and their corresponding region masks to transform the input image into a novel view. To this end, we develop a new region-aware geometric transform network that performs these multiple tasks in a common framework. Our results on the outdoor KITTI and the indoor ScanNet datasets demonstrate the effectiveness of our network in generating high quality synthetic views that respect the scene geometry, thus outperforming the state-of-the-art methods.
研究动机与目标
- 解决在具有丰富几何结构的复杂真实场景中,从单张图像进行新颖视图合成的挑战。
- 克服仅依赖外观学习方法导致的几何不一致伪影问题。
- 通过使用固定数量的平面区域显式建模三维场景几何,以提升视图合成质量。
- 开发一个统一的深度学习框架,联合预测单应性矩阵、区域掩码,并利用可学习的选择图融合变形视图。
提出的方法
- 使用固定数量的平面区域近似三维场景,每个平面区域关联一个由预测的深度图和法线图以及相对相机位姿推导出的单应性矩阵。
- 采用双流深度神经网络:一个分支从输入图像估计像素级深度和法线,另一个分支为每个平面区域预测一个选择图。
- 利用预测的单应性矩阵对输入图像进行基于单应性的变形,为每个平面区域生成多个候选变形视图。
- 通过预测的选择图融合变形视图,且选择图本身也通过相同的单应性矩阵进行变形,以确保空间一致性。
- 利用带有跳跃连接的编码器-解码器网络对最终合成视图进行细化,以纠正模糊和缺失像素问题。
- 采用一种区域感知的几何变换网络,将几何约束整合到光流预测过程中,确保结构一致性。
实验结果
研究问题
- RQ1显式建模三维场景几何是否能提升从单张图像合成的新颖视图的真实感与结构一致性?
- RQ2与端到端外观光流相比,学习区域特定的单应性矩阵和选择图在几何保真度方面表现如何?
- RQ3预测的深度图和法线图的质量在多大程度上影响几何感知合成框架的性能?
- RQ4与硬分割或固定掩码相比,可学习的选择图机制是否能改善多个变形视图的融合效果?
- RQ5引入几何先验是否能减少如局部结构扭曲和物体形状不一致等伪影?
主要发现
- 所提方法在KITTI和ScanNet数据集上均优于最先进的人工外观光流方法[29],展现出更优的几何一致性和视觉质量。
- 在KITTI数据集上,使用估计的深度和法线图以及可学习选择图时,L1误差降低至0.329,而使用真实深度和法线图且无可学习选择图时,L1误差为0.357。
- 定性结果表明,该方法生成的视图更具真实感,尤其在保持物体形状和场景结构(如建筑立面和树木区域)方面表现更优。
- 细化网络虽轻微降低了定量指标的准确性,但显著提升了视觉真实感,表明度量保真度与感知质量之间存在权衡。
- 消融实验确认,学习选择图至关重要——使用真实深度和法线图配合可学习选择图时性能最佳,凸显了自适应融合的重要性。
- 选择网络成功将种子区域扩展为更大、语义一致的平面区域,如整棵树或建筑立面,如可视化结果所示。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。