Skip to main content
QUICK REVIEW

[论文解读] Layer-structured 3D Scene Inference via View Synthesis

Shubham Tulsiani, Richard Tucker|arXiv (Cornell University)|Jul 26, 2018
Advanced Vision and Imaging参考文献 27被引用 5
一句话总结

本文提出一种基于学习的方法,通过视图合成作为代理监督任务,从单张图像推断分层结构的3D场景表示。通过训练CNN模型预测分层深度图(LDI),使得从新视角渲染出的图像与观测图像匹配,该模型能够捕捉可见像素之外的隐藏场景几何与纹理,实现在合成数据和真实KITTI数据上的竞争性深度预测及改进的视图合成效果。

ABSTRACT

We present an approach to infer a layer-structured 3D representation of a scene from a single input image. This allows us to infer not only the depth of the visible pixels, but also to capture the texture and depth for content in the scene that is not directly visible. We overcome the challenge posed by the lack of direct supervision by instead leveraging a more naturally available multi-view supervisory signal. Our insight is to use view synthesis as a proxy task: we enforce that our representation (inferred from a single image), when rendered from a novel perspective, matches the true observed image. We present a learning framework that operationalizes this insight using a new, differentiable novel view renderer. We provide qualitative and quantitative validation of our approach in two different settings, and demonstrate that we can learn to capture the hidden aspects of a scene.

研究动机与目标

  • 通过从单张图像推断隐藏几何与纹理,实现超越可见像素的3D场景理解。
  • 通过将多视角监督作为代理任务,克服缺乏直接3D监督的问题。
  • 开发一种支持分层深度图(LDI)预测与新视角生成的可微分渲染机制。
  • 在具有真实标签的合成数据和使用KITTI数据集的真实户外场景上验证该方法。
  • 证明学习得到的LDI表示能够泛化至新视角合成,并在2.5D表示之外提升深度估计性能。

提出的方法

  • 该方法使用CNN从单张输入图像预测分层深度图(LDI),其中每个像素存储多个深度层及其对应的颜色。
  • 引入一种新颖的可微分前向点投影层,实现对预测LDI的可微分渲染,从而支持端到端训练。
  • 通过视图合成损失强制要求从预测LDI渲染出的新视角与真实观测图像匹配,作为训练目标。
  • 在训练中使用多视角监督:对于每对图像,模型从一个视角预测LDI,并从该LDI渲染出另一个视角。
  • 该方法利用校准相机获取的立体图像对(如KITTI)为遮挡区域提供间接监督。
  • 使用标准CNN优化方法,通过渲染图像与目标图像之间的像素级L1损失进行模型训练。

实验结果

研究问题

  • RQ1在缺乏直接3D监督的情况下,单张图像3D场景表示能否推断出遮挡区域的几何与纹理?
  • RQ2视图合成能否作为强代理任务,有效监督从单张图像进行3D场景推理?
  • RQ3与2.5D深度图相比,分层深度图(LDI)表示是否能实现更好的新视角泛化能力?
  • RQ4在基线运动受限的真实户外场景中,该模型表现如何?
  • RQ5该模型能否学习推断被遮挡物后方结构(如建筑物在树木后的延续)?

主要发现

  • 两层LDI模型在KITTI数据集上的所有像素上视图合成误差为0.0581,在非遮挡像素上为0.0800,优于单层模型。
  • 模型在非遮挡像素上的表现更优(误差0.0800 vs. 0.0813),表明其对隐藏几何的建模能力更强。
  • 在KITTI测试集上,该模型实现了0.1856的绝对相对深度误差,与Zhou等人提出的最先进方法(0.2079)相当。
  • 定性结果表明,模型能成功生成遮挡区域的合理纹理与深度,如树木后方的建筑延伸。
  • 在合成数据中,背景层的利用效果优于真实KITTI数据,可能由于基线运动较小,限制了深度视 parallax。
  • 可微分LDI渲染器支持端到端训练,并实现无需显式3D监督的新视角合成泛化。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。