[论文解读] Semi-supervised Implicit Scene Completion from Sparse LiDAR
该论文提出了一种基于学习形状嵌入作为密集边界约束的半监督隐式场景补全方法,用于稀疏LiDAR点云,实现了无需自由空间真实SDF值的鲁棒符号距离函数学习。该方法在SemanticKITTI上实现了51.0%的IoU,显著优于SIREN,通过两个并行分支实现了隐式语义补全。
Recent advances show that semi-supervised implicit representation learning can be achieved through physical constraints like Eikonal equations. However, this scheme has not yet been successfully used for LiDAR point cloud data, due to its spatially varying sparsity. In this paper, we develop a novel formulation that conditions the semi-supervised implicit function on localized shape embeddings. It exploits the strong representation learning power of sparse convolutional networks to generate shape-aware dense feature volumes, while still allows semi-supervised signed distance function learning without knowing its exact values at free space. With extensive quantitative and qualitative results, we demonstrate intrinsic properties of this new learning system and its usefulness in real-world road scenes. Notably, we improve IoU from 26.3% to 51.0% on SemanticKITTI. Moreover, we explore two paradigms to integrate semantic label predictions, achieving implicit semantic completion. Code and models can be accessed at https://github.com/OPEN-AIR-SUN/SISC.
研究动机与目标
- 解决由于空间稀疏性变化和法向估计不可靠导致的半监督SDF学习在稀疏LiDAR数据上的失败问题。
- 提出一种新公式,通过基于学习的、与形状相关的密集嵌入来条件化隐式函数学习,从而在无需自由空间精确SDF值的情况下稳定训练。
- 仅使用稀疏LiDAR输入和有限监督,实现在真实道路场景中的隐式几何与语义场景补全。
- 将语义理解整合到隐式表示框架中,实现端到端的隐式语义补全。
提出的方法
- 混合架构结合了用于从稀疏点云中学习判别性形状嵌入的稀疏卷积网络,以及基于这些嵌入条件化预测SDF值的生成模型。
- 形状嵌入作为密集的、数据驱动的边界值,编码了表面点(零阶)和法向方向(一阶)约束。
- 通过三线性插值或最近邻采样从形状编码中检索输入坐标处的嵌入,从而在无显式SDF监督的自由空间中实现SDF预测。
- 通过基于嵌入的监督放松Eikonal约束,降低对噪声或稀疏离面锚点的敏感性。
- 提出了两种语义补全范式:(1) 使用K-NN映射到隐式空间的密集语义头,(2) 用于语义标签场的并行隐式生成头。
- 使用高阶频率(如L=10)的位置编码,以在SDF预测中保留精细几何细节。
实验结果
研究问题
- RQ1半监督隐式学习能否成功应用于稀疏LiDAR数据,而此前的方法(如SIREN)因稀疏性和不可靠法向而失败?
- RQ2如何利用形状嵌入在无需自由空间真实SDF值的情况下,为SDF学习提供有效的密集边界约束?
- RQ3在稀疏LiDAR场景中,学习到的形状嵌入能在多大程度上提升隐式场景表示的一致性与完整性?
- RQ4所提出的框架能否实现隐式语义场景补全?与显式语义补全基线相比表现如何?
- RQ5位置编码的引入是否显著影响隐式场景补全的质量?
主要发现
- 该方法在SemanticKITTI基准上实现了51.0%的IoU,显著优于SIREN的26.3%。
- 消融实验表明,使用L=10的位置编码并包含原始坐标时性能最佳(IoU为51.020),而省略该设置则使IoU降至40.431。
- 形状嵌入的t-SNE可视化显示了清晰的聚类和锐利边界,表明其有效编码了表面点与法向约束。
- 通过SSC-A和SSC-B头实现的隐式语义补全分别达到mIoU 20.2%和18.0%,当将JS3C-Net的显式预测映射到隐式空间后,性能进一步提升至23.4%。
- 在任意分辨率下的网格重建结果展示了学习到的SDF场的连续性,即使在更高分辨率下也保持几何一致性。
- 定性结果表明,与SIREN相比,该方法在稀疏区域生成了更完整、更连贯的重建结果。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。