Skip to main content
QUICK REVIEW

[论文解读] Neural Rerendering in the Wild

Moustafa Meshry, Dan B Goldman|ArXiv.org|Apr 8, 2019
Advanced Vision and Imaging参考文献 45被引用 9
一句话总结

本文提出了一种神经重渲染框架,仅使用互联网照片即可实现对旅游景点的真实感、外观可控的渲染。通过重建3D点云代理,并在带有外观和语义条件的延迟着色缓冲区上训练条件生成对抗网络(conditional GAN),该模型在多种光照和瞬态条件下实现了高保真度的视角与外观插值,在特雷维喷泉和万神殿等多个数据集上的表现优于以往方法。

ABSTRACT

We explore total scene capture -- recording, modeling, and rerendering a scene under varying appearance such as season and time of day. Starting from internet photos of a tourist landmark, we apply traditional 3D reconstruction to register the photos and approximate the scene as a point cloud. For each photo, we render the scene points into a deep framebuffer, and train a neural network to learn the mapping of these initial renderings to the actual photos. This rerendering network also takes as input a latent appearance vector and a semantic mask indicating the location of transient objects like pedestrians. The model is evaluated on several datasets of publicly available images spanning a broad range of illumination conditions. We create short videos demonstrating realistic manipulation of the image viewpoint, appearance, and semantic labeling. We also compare results with prior work on scene reconstruction from internet photos.

研究动机与目标

  • 仅使用公开可获取的互联网照片,实现完整场景捕获——记录并重渲染任意外观下的场景。
  • 解决传统3D重建方法的局限性,后者生成的渲染结果不真实且缺乏外观多样性。
  • 通过显式的3D代理将输入图像分解为视角、外观和语义内容,以提升控制力与真实感。
  • 开发分阶段训练策略,先使用代理风格损失对外观编码器进行预训练,从而提升潜在空间质量与模型泛化能力。

提出的方法

  • 该方法首先从互联网照片中进行3D重建,生成一个密集但噪声较大的点云作为3D代理。
  • 对每张输入图像,从点云中渲染出一个深度帧缓冲(deferred-shading buffer),存储深度、颜色和语义标签。
  • 基于条件生成对抗网络(conditional GAN)的重渲染网络接收深度帧缓冲、潜在外观向量和语义掩码作为输入,生成真实感图像。
  • 在冻结前,使用基于代理风格的损失(如感知损失)对外观编码器进行预训练,以用于条件化重渲染网络。
  • 分阶段训练包括:首先预训练外观编码器,然后使用固定嵌入量训练重渲染网络,最后联合微调两个网络。
  • 使用语义掩码对网络进行条件化,以忽略或移除瞬态物体(如行人),从而提升鲁棒性并实现无行人渲染。

实验结果

研究问题

  • RQ1神经重渲染系统能否仅使用未经控制的互联网照片,在不同外观下生成场景的逼真图像?
  • RQ2与端到端训练相比,使用代理外观损失的分阶段训练在学习解耦且有意义的外观潜在空间方面有多高效?
  • RQ3语义条件化在多大程度上能提升模型处理弱重建场景中瞬态物体和几何伪影的能力?
  • RQ4该模型在不同光照、天气和一天中不同时段条件下的视角与外观插值性能如何?
  • RQ5当仅使用3D点云代理且无特殊采集手段时,该系统在从互联网照片进行场景重建方面是否优于以往工作?

主要发现

  • 该模型在视角与外观插值任务上表现优异,在特雷维喷泉、万神殿和杜布罗夫尼克数据集上,即使使用估计的分割掩码,也优于BicycleGAN基线模型。
  • 采用外观预训练的分阶段训练方法使潜在空间更具语义意义和结构化,t-SNE可视化显示微调后形成清晰聚类。
  • 即使在使用估计的分割掩码(如真实世界设置)下,模型仍保持强大性能,特雷维喷泉的PSNR值为17.90,万神殿为17.29。
  • 神经重渲染网络成功推断出遮挡关系,并避免了点云渲染中的伪影,如图11所示,尽管初始渲染中可见内部结构。
  • 该系统支持真实感视频风格的视角、外观和语义内容操控,包括通过语义条件化实现的无行人渲染。
  • 通过预训练学习到的潜在外观空间在质量和聚类方面均优于初始阶段,接近BicycleGAN基线模型的水平。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。