[论文解读] SceneCode: Monocular Dense Semantic Reconstruction using Learned Encoded Scene Representations
本论文提出 SceneCode,一种单目稠密语义 SLAM 系统,利用条件变分自编码器(CVAE)学习几何与语义的紧凑、可优化潜在编码。通过在重叠视图间联合优化这些编码,实现了保持空间相关性的连贯、高质量语义标签融合,mIoU 性能优于逐像素融合方法,实现了姿态、几何与语义的端到端联合优化,获得鲁棒、一致的 3D 场景重建。
Systems which incrementally create 3D semantic maps from image sequences must store and update representations of both geometry and semantic entities. However, while there has been much work on the correct formulation for geometrical estimation, state-of-the-art systems usually rely on simple semantic representations which store and update independent label estimates for each surface element (depth pixels, surfels, or voxels). Spatial correlation is discarded, and fused label maps are incoherent and noisy. We introduce a new compact and optimisable semantic representation by training a variational auto-encoder that is conditioned on a colour image. Using this learned latent space, we can tackle semantic label fusion by jointly optimising the low-dimenional codes associated with each of a set of overlapping images, producing consistent fused label maps which preserve spatial correlation. We also show how this approach can be used within a monocular keyframe based semantic mapping system where a similar code approach is used for geometry. The probabilistic formulation allows a flexible formulation where we can jointly estimate motion, geometry and semantics in a unified optimisation.
研究动机与目标
- 解决现有语义 SLAM 系统将语义标签独立处理为每个表面元素所导致的不连贯与噪声融合地图的问题。
- 开发一种紧凑、可微分且可优化的语义分割表示,以保留跨视图的空间相关性。
- 将学习到的语义编码集成到基于关键帧的单目 SLAM 系统中,实现几何与语义与相机运动的联合优化。
- 证明基于编码的融合在一致性与 mIoU 上优于传统逐像素标签融合,尤其在模糊区域表现更优。
- 仅使用单个 RGB 相机,实现鲁棒、实时的 3D 场景重建,并生成连贯的语义标签。
提出的方法
- 训练一个多任务条件变分自编码器(CVAE),将输入 RGB 图像映射为几何(深度)和语义(分割标签)的低维潜在编码。
- 语义 CVAE 学习基于输入图像的语义标签多模态、概率分布,实现具有不确定性感知与一致性的预测。
- 通过在共享编码空间中联合优化重叠图像的潜在编码,并引入零编码正则化先验,实现多视图语义标签融合,强制保持一致性。
- 将几何与语义整合到统一的优化框架中,通过可微分流水线联合优化相机位姿、几何编码与语义编码。
- 采用滑动窗口方法实现单目 SLAM 实时性,关键帧存储紧凑编码而非原始标签或表面元。
- 网络架构采用 U 形编码器-解码器结构,主干网络为 ResNet-50,用于图像编码,全卷积头用于潜在编码预测。
实验结果
研究问题
- RQ1学习到的低维潜在编码能否以保留空间相关性的方式表示语义分割,从而实现连贯的多视图标签融合?
- RQ2与基于表面元素的融合相比,跨视图的基于编码的联合优化在标签一致性与准确性方面表现如何?
- RQ3紧凑的语义表示能否有效集成到单目 SLAM 系统中,以实现几何、语义与相机位姿的联合优化?
- RQ4零编码正则化先验对语义优化的影响如何,特别是在模糊或低置信度区域?
- RQ5基于单图像 CVAE 的表示在多大程度上能够支持从单目视频实现鲁棒、实时的稠密语义重建?
主要发现
- 所提出的编码优化方法在 SceneNet RGB-D 数据集的双视图融合中达到 43.842 mIoU,显著优于基线方法(如乘法融合为 42.326 mIoU,平均融合为 42.220 mIoU)。
- 若不使用零编码正则化先验,双视图融合准确率下降至 39.600 mIoU,表明该先验可防止收敛至局部一致但错误的标签。
- 优化后模糊区域的熵降低,表明模型置信度提高,预测更平滑、更连贯,优于独立的像素级融合方法。
- 定性结果表明,该方法在重叠视图间生成了更平滑、更一致的语义标签,尤其在低置信度的挑战性区域表现更优。
- 系统成功从单目视频重建出稠密且一致的 3D 语义地图,展示了在初始化阶段及纯旋转运动下的鲁棒性。
- 通过共享潜在编码联合优化几何与语义,实现了更紧密的耦合,相比解耦方法显著提升了整体场景表示质量。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。