Skip to main content
QUICK REVIEW

[论文解读] Novel View Synthesis for Large-scale Scene using Adversarial Loss

Xiaochuan Yin, Henglai Wei|arXiv (Cornell University)|Feb 20, 2018
Advanced Vision and Imaging参考文献 17被引用 8
一句话总结

本文提出了一种完全卷积的端到端深度学习框架,用于在大规模户外场景中进行新视角合成,采用对抗性损失和逆深度特征。通过显式地利用CNN学习的稀疏深度监督来引入几何结构,并结合带有变换约束的生成对抗网络(GAN)损失,该方法即使在相机自身运动较大的情况下,也能从新视角生成高质量、无失真的图像,在KITTI数据集上的定性和定量评估中均优于基线方法。

ABSTRACT

Novel view synthesis aims to synthesize new images from different viewpoints of given images. Most of previous works focus on generating novel views of certain objects with a fixed background. However, for some applications, such as virtual reality or robotic manipulations, large changes in background may occur due to the egomotion of the camera. Generated images of a large-scale environment from novel views may be distorted if the structure of the environment is not considered. In this work, we propose a novel fully convolutional network, that can take advantage of the structural information explicitly by incorporating the inverse depth features. The inverse depth features are obtained from CNNs trained with sparse labeled depth values. This framework can easily fuse multiple images from different viewpoints. To fill the missing textures in the generated image, adversarial loss is applied, which can also improve the overall image quality. Our method is evaluated on the KITTI dataset. The results show that our method can generate novel views of large-scale scene without distortion. The effectiveness of our approach is demonstrated through qualitative and quantitative evaluation.

研究动机与目标

  • 为解决在由于相机自身运动导致背景结构显著变化的大规模户外环境中生成高质量新视角的挑战。
  • 克服现有基于几何和基于学习的方法的局限性,这些方法要么需要密集的3D重建,要么无法在不同视角间保持结构一致性。
  • 通过用对抗性训练替代标准L2损失,提升合成视角的图像质量并减少模糊。
  • 实现来自不同视角的多张输入图像的融合,以增强结构一致性和细节恢复。
  • 开发一种完全卷积的神经网络,支持任意大小的输入图像和带有几何监督的端到端训练。

提出的方法

  • 该框架使用一个完全卷积的神经网络,以单张输入图像及其对应的相机位姿作为输入,通过在稀疏标注深度值上训练的CNN提取逆深度特征,以编码几何结构。
  • 网络采用双线性采样方法,基于相机变换和逆深度对特征进行变形,从而实现从新视角进行可微分的图像生成。
  • 使用生成对抗网络(GAN)作为主要损失函数,以提升感知质量和减少模糊,并在判别器中增加一个辅助变换约束,以保持位姿一致性。
  • 对于多图像输入,在多个视角的特征图上应用最大值选择层,随后通过一个融合卷积层减少伪影并提高细节保真度。
  • 整个网络通过组合损失进行端到端训练:包括带有变换约束的对抗性损失和用于像素级重建的L1损失。
  • 该方法通过将几何信息直接嵌入特征图中,避免了显式的3D重建,从而实现高效且可扩展的推理。

实验结果

研究问题

  • RQ1与标准L1或L2损失相比,对抗性训练是否能显著提升大规模场景中新视角合成的感知质量?
  • RQ2在不进行显式3D重建的情况下,从稀疏深度监督中提取的逆深度特征在多大程度上能有效编码结构几何信息用于视角合成?
  • RQ3在复杂户外环境中,多视角融合在多大程度上提升了合成图像的准确性和细节表现?
  • RQ4该框架是否能泛化到任意大小的输入图像,并在无需微调的情况下保持性能?
  • RQ5在GAN判别器中引入变换约束是否能增强生成视角中的位姿一致性和结构保真度?

主要发现

  • 在KITTI数据集上,该方法使用两张输入图像时L1误差达到0.2318,优于外观光流基线方法(0.2698),表明其具有更优的结构保真度。
  • 该方法在融合处理后,Inception分数为3.0945 ± 0.1060,与基线外观光流方法(3.0959 ± 0.0788)相当,表明图像多样性与质量均表现优异。
  • 定性结果表明,即使在大范围相机自身运动下,该方法仍能保持场景结构并避免失真,而基线方法则引入了伪影。
  • 使用对抗性损失显著提升了图像锐度和纹理真实感,有效减少了L2损失方法中常见的模糊现象。
  • 在最大值选择之后添加融合层,有效减少了双边缘和噪声,提升了多视角合成中的视觉连贯性和细节恢复能力。
  • 该框架成功实现了对任意尺寸输入图像的高质量图像生成,并支持无需中间3D重建的端到端训练。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。