[论文解读] SG-NN: Sparse Generative Neural Networks for Self-Supervised Scene Completion of RGB-D Scans
该论文提出SG-NN,一种自监督稀疏生成神经网络,通过从同一真实世界扫描的逐步更不完整的版本中学习,完成不完整的RGB-D扫描,实现在无需合成真实标签的情况下进行高分辨率(2厘米)三维场景重建。该方法在泛化真实数据方面优于完全监督的最先进方法,能够预测比任何单一训练扫描更完整的几何结构。
We present a novel approach that converts partial and noisy RGB-D scans into high-quality 3D scene reconstructions by inferring unobserved scene geometry. Our approach is fully self-supervised and can hence be trained solely on real-world, incomplete scans. To achieve self-supervision, we remove frames from a given (incomplete) 3D scan in order to make it even more incomplete; self-supervision is then formulated by correlating the two levels of partialness of the same scan while masking out regions that have never been observed. Through generalization across a large training set, we can then predict 3D scene completion without ever seeing any 3D scan of entirely complete geometry. Combined with a new 3D sparse generative neural network architecture, our method is able to predict highly-detailed surfaces in a coarse-to-fine hierarchical fashion, generating 3D scenes at 2cm resolution, more than twice the resolution of existing state-of-the-art methods as well as outperforming them by a significant margin in reconstruction quality.
研究动机与目标
- 解决由于遮挡和传感器限制导致的RGB-D扫描中三维重建不完整的问题。
- 消除对合成的、完全完整的三维数据集进行训练场景补全模型的依赖。
- 开发一种自监督学习框架,能够在真实世界扫描之间泛化,以预测比任一输入更完整的几何结构。
- 通过一种新型稀疏生成网络架构,实现高分辨率(2厘米)的三维场景生成。
- 在不同输入不完整程度下,提升场景补全的泛化能力和鲁棒性。
提出的方法
- 该方法使用一种自监督损失,关联来自同一扫描的两个部分完整度级别:一个不完整程度较低的输入和一个更不完整的目标,同时对未观测区域进行掩码处理。
- 采用分层的、从粗到细的训练策略,逐步将预测几何的分辨率从低到高(2厘米)提升。
- 提出一种新型稀疏生成神经网络架构,以端到端、全卷积的方式预测稀疏截断符号距离函数(TSDF)表示。
- 在Matterport3D的真实世界RGB-D扫描上进行训练,通过移除帧来模拟逐渐增加的不完整性。
- 损失函数强制预测的输入与目标部分扫描之间的差异保持一致,同时对未观测区域进行掩码处理,以避免从未观测几何中学习。
- 该方法对输入和输出均使用TSDF表示,相比点云或占用网格,能更准确地描述表面几何和邻域结构。
实验结果
研究问题
- RQ1自监督方法能否在不使用任何合成真实标签的情况下,从真实世界不完整的RGB-D扫描中学习完成三维场景?
- RQ2此类方法能否泛化到预测比任何单个训练扫描更完整的几何结构?
- RQ3具有渐进式分辨率训练的稀疏生成网络是否能实现比现有方法更高的重建质量和分辨率?
- RQ4该方法在训练期间对不同输入扫描完整度水平的鲁棒性如何?
- RQ5在损失函数中对未观测区域进行掩码处理,是否相比随机裁剪或直接监督,能显著改善遮挡区域的补全效果?
主要发现
- 所提出的自监督方法在三维场景重建中实现了2厘米的分辨率,比先前最先进方法的分辨率高出两倍以上。
- 尽管仅在不完整的实际扫描上进行训练,该模型仍能预测出比训练过程中任何单一目标扫描更完整的几何结构,尤其在遮挡区域表现更优。
- 该方法在重建质量上优于完全监督的最先进方法,即使后者可访问大规模合成数据集。
- 该模型在不同目标扫描完整度水平下均保持鲁棒性,即使仅使用30%的帧进行训练,仍能保持强大性能。
- 在损失函数中对未观测区域进行掩码处理,显著提升了遮挡区域的补全效果,而随机裁剪基线方法在这些区域表现失败。
- 对输入和输出均使用TSDF表示,相比点云或占用网格表示,性能更优,原因在于其对几何特征的描述能力更强。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。