Skip to main content
QUICK REVIEW

[论文解读] Continuous Object Representation Networks: Novel View Synthesis without Target View Supervision

Nicolai Häni, Selim Engin|arXiv (Cornell University)|Jul 30, 2020
Advanced Vision and Imaging参考文献 10被引用 7
一句话总结

本文提出连续物体表征网络(CORN),一种自监督神经网络,通过仅学习两个输入图像的连续可微分3D场景表征,实现新颖视角的合成。通过利用变换链和3D特征一致性作为自监督信号,CORN在无需3D真实值或目标视角监督的情况下,实现了新颖视角合成与单视角3D重建的最先进性能,且训练图像数量仅为先前方法的1/50。

ABSTRACT

Novel View Synthesis (NVS) is concerned with synthesizing views under camera viewpoint transformations from one or multiple input images. NVS requires explicit reasoning about 3D object structure and unseen parts of the scene to synthesize convincing results. As a result, current approaches typically rely on supervised training with either ground truth 3D models or multiple target images. We propose Continuous Object Representation Networks (CORN), a conditional architecture that encodes an input image's geometry and appearance that map to a 3D consistent scene representation. We can train CORN with only two source images per object by combining our model with a neural renderer. A key feature of CORN is that it requires no ground truth 3D models or target view supervision. Regardless, CORN performs well on challenging tasks such as novel view synthesis and single-view 3D reconstruction and achieves performance comparable to state-of-the-art approaches that use direct supervision. For up-to-date information, data, and code, please see our project page: https://nicolaihaeni.github.io/corn/.

研究动机与目标

  • 开发一种新颖视角合成方法,可在不依赖3D真实值或多视角监督的情况下,实现对不同物体实例的泛化能力。
  • 通过每类物体仅使用两张图像进行训练,降低3D场景表征学习中的数据依赖性。
  • 实现端到端可训练的连续3D场景表征,支持高分辨率、多视角一致的渲染。
  • 证明在有限监督下实现自监督3D重建与域外泛化的可行性。

提出的方法

  • CORN通过将两张输入图像的局部与全局特征编码为一个空间特征图,学习连续可微分的3D表征。
  • 模型利用变换链将特征从一个源视角映射到另一个视角,通过强制3D特征一致性作为自监督信号。
  • 可微分神经渲染器通过从隐式3D表征中渲染新颖视角,支持端到端训练。
  • 通过循环一致性强制多视角一致性:特征从视角A变换到B,再从B变回A,最小化重建误差。
  • 该架构为条件式设计,允许在推理阶段仅用单张图像快速生成结果,无需优化潜在变量。
  • 该方法避免使用离散表征(如体素或点云),从而支持任意空间分辨率并降低内存开销。

实验结果

研究问题

  • RQ1神经网络能否在无任何3D监督的情况下,仅从两张图像中学习到一致的3D场景表征?
  • RQ2通过特征一致性与变换链实现的自监督训练,能否达到与监督方法相当的性能?
  • RQ3该模型能否在未在训练中见过的域外姿态或真实世界图像上实现良好泛化?
  • RQ4仅使用单张输入图像和学习到的表征,是否能够实现高质量的单视角3D重建?

主要发现

  • CORN仅使用每类物体两张训练图像,即在新颖视角合成任务中达到最先进性能,优于需要数十张图像及直接目标视角监督的方法。
  • 即使在合成ShapeNet数据上进行训练,模型在Cars数据集的真实世界图像上仍表现出良好泛化能力,证明了其域迁移能力。
  • 仅用单张输入图像即可实现高质量的单视角3D重建,能准确捕捉全局形状与精细细节。
  • CORN在视角间保持了强大的几何与光照一致性,即使源图像来自相似或非重叠视角亦然。
  • 与最先进监督方法相比,该方法将数据需求降低了50倍,同时性能匹配或超越后者。
  • 通过变换链与3D特征一致性实现的自监督训练方案,成功避免了平凡解,实现了稳定且有意义的3D表征学习。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。