Skip to main content
QUICK REVIEW

[论文解读] PlaneNet: Piece-wise Planar Reconstruction from a Single RGB Image

Chen Liu, Shuicheng Yan|arXiv (Cornell University)|Apr 17, 2018
Advanced Vision and Imaging参考文献 39被引用 15
一句话总结

PlaneNet 提出了一种端到端的深度神经网络,能够直接从单张 RGB 图像中预测分段平面几何结构——包括平面参数和概率分割掩码,通过采用对平面排序不变的损失函数,并利用来自 ScanNet 的 50,000 多个合成训练样本,在平面分割和深度估计任务上均取得了当前最优性能。

ABSTRACT

This paper proposes a deep neural network (DNN) for piece-wise planar depthmap reconstruction from a single RGB image. While DNNs have brought remarkable progress to single-image depth prediction, piece-wise planar depthmap reconstruction requires a structured geometry representation, and has been a difficult task to master even for DNNs. The proposed end-to-end DNN learns to directly infer a set of plane parameters and corresponding plane segmentation masks from a single RGB image. We have generated more than 50,000 piece-wise planar depthmaps for training and testing from ScanNet, a large-scale RGBD video database. Our qualitative and quantitative evaluations demonstrate that the proposed approach outperforms baseline methods in terms of both plane segmentation and depth estimation accuracy. To the best of our knowledge, this paper presents the first end-to-end neural architecture for piece-wise planar reconstruction from a single RGB image. Code and data are available at https://github.com/art-programmer/PlaneNet.

研究动机与目标

  • 为解决从单张 RGB 图像中重建结构化、分段平面深度图的挑战,尽管单图像深度预测技术已取得进展,但该任务仍具挑战性。
  • 开发一种深度学习框架,能够联合预测平面参数和分割掩码,而无需事先知道平面的数量或顺序。
  • 通过使用可微分的、与顺序无关的损失函数建模室内场景的几何结构,提升平面分割和深度估计的准确性。
  • 通过一种稳健的、端到端的神经架构,支持增强现实和房间布局估计等下游应用。
  • 通过从 ScanNet 数据集生成超过 50,000 个高质量的合成训练和测试样本,建立分段平面重建的基准。

提出的方法

  • 网络端到端训练,从单张 RGB 图像中预测一组平面参数(法向量和距离)以及每个平面的概率分割掩码。
  • 设计了一种新颖的损失函数,使其对输出中平面顺序的变化保持不变,从而在无需真实平面排序监督的情况下进行训练。
  • 通过允许分割掩码全为零来控制平面数量,有效抑制置信度较低的平面。
  • 在非平面区域预测深度图,并通过概率分割掩码对损失进行加权,以支持反向传播。
  • 利用平面法向量通过投票机制提取曼哈顿方向,实现纹理编辑应用中的 UV 坐标对齐。
  • 基于预测平面的一致排序构建房间布局估计模块,采用凹包构造和跨配置的一致性评分。

实验结果

研究问题

  • RQ1深度神经网络能否在不依赖平面顺序或数量监督的情况下,从单张 RGB 图像中学习预测平面参数和分割掩码?
  • RQ2如何设计一种可微分的损失函数,使其在多平面预测任务中对平面输出的排列保持不变?
  • RQ3与专门针对深度或布局训练的方法相比,单图像网络在平面分割和深度估计方面能实现多大程度的性能提升?
  • RQ4预测的平面排序是否可用于在杂乱或遮挡场景中推断房间布局?
  • RQ5在低纹理或高度杂乱环境中,此类系统的失效模式是什么?

主要发现

  • PlaneNet 在平面分割任务中达到当前最优性能,无论在定性还是定量基准上均显著优于现有方法。
  • 尽管未专门针对该任务进行训练,模型在深度预测精度上与专用的单图像深度估计网络相当或更优。
  • 在 NYUv2 303 数据集上,PlaneNet 的布局误差为 12.64%,优于先前最先进方法(RoomNet)的 12.96% 误差率。
  • 网络在无监督条件下学习到了一致的平面排序——例如,地板始终被一致预测为第二个平面——从而实现可靠的房间布局估计。
  • 失效模式包括在低光照区域将几乎共面的表面误分类、将纹理相似的地板和墙面表面混淆,以及因杂乱而无法检测到细长结构(如柱子)。
  • 该方法通过利用从预测法向量导出的平面对齐 UV 坐标,支持实用的增强现实应用,如纹理插入和替换。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。