Skip to main content
QUICK REVIEW

[论文解读] ILabel: Interactive Neural Scene Labelling

Shuaifeng Zhi, Edgar Sucar|arXiv (Cornell University)|Nov 29, 2021
Robotics and Sensor-Based Localization参考文献 35被引用 18
一句话总结

iLabel 提出了一种交互式、实时的3D场景标注系统,利用神经场从超稀疏的用户点击中联合表示几何、颜色和语义信息,且无需预训练数据。该系统仅需数十次点击即可实现比预训练模型更高的语义标注准确率,在如Replica这样的低数据场景下也优于当前最先进方法,并支持开放集标注和无点击的不确定性引导标注。

ABSTRACT

Joint representation of geometry, colour and semantics using a 3D neural field enables accurate dense labelling from ultra-sparse interactions as a user reconstructs a scene in real-time using a handheld RGB-D sensor. Our iLabel system requires no training data, yet can densely label scenes more accurately than standard methods trained on large, expensively labelled image datasets. Furthermore, it works in an 'open set' manner, with semantic classes defined on the fly by the user. ILabel's underlying model is a multilayer perceptron (MLP) trained from scratch in real-time to learn a joint neural scene representation. The scene model is updated and visualised in real-time, allowing the user to focus interactions to achieve efficient labelling. A room or similar scene can be accurately labelled into 10+ semantic categories with only a few tens of clicks. Quantitative labelling accuracy scales powerfully with the number of clicks, and rapidly surpasses standard pre-trained semantic segmentation methods. We also demonstrate a hierarchical labelling variant.

研究动机与目标

  • 在人类交互最少的情况下实现高精度、密集的3D语义标注,尤其适用于低数据或全新环境。
  • 通过仅使用用户提供的点击实时从零开始训练神经场,彻底摆脱对大规模预标注数据集的依赖。
  • 支持开放集语义标注,用户可在扫描过程中即时定义新类别。
  • 通过提供实时视觉反馈和交互式错误修正,提升用户效率。
  • 探索基于不确定性的无点击标注方法,减少手动点击负担。

提出的方法

  • 使用实时神经场SLAM系统,通过从零训练的多层感知机(MLP)联合构建几何、外观和语义的3D表示。
  • 通过关键帧图像上的稀疏用户点击监督语义预测,并利用神经场的归纳偏差将预测结果传播至整个场景。
  • 通过实时渲染预测结果,实现用户参与的交互式流程,支持错误修正和新类别的添加。
  • 采用分层标注策略,将语义输出解释为二叉树分支,实现结构化分类。
  • 实现自动查询生成模式,通过不确定性采样选择不确定像素供用户标注,无需点击操作。
  • 利用基于视角的神经表示并结合空间连续性,实现对几何和纹理区域的泛化能力。

实验结果

研究问题

  • RQ1神经场表示能否在无需大规模预训练数据集的情况下,仅通过超稀疏用户交互实现密集语义标注?
  • RQ2在实时交互系统中,标注准确率随用户点击数的增加,与预训练模型相比如何变化?
  • RQ3系统能否支持开放集语义标注,即用户在扫描过程中动态定义新类别?
  • RQ4不确定性引导的自动查询生成在减少手动点击输入的同时,能否保持高准确率?
  • RQ5神经场的归纳偏差是否能实现在复杂真实场景中鲁棒且精确的语义传播?

主要发现

  • 在Replica数据集上,iLabel仅用20次点击即超越了当前最先进预训练RGB-D分割模型(SA-Gate)的性能,该数据集属于低数据场景,仅提供7个场景用于微调。
  • 在ScanNet数据集上,iLabel在约50次点击时达到与预训练基线相当的准确率,并在120次点击时超出基线20%。
  • 自动查询生成模式的性能与手动点击相当,但需约240次点击,凸显了直接用户交互的效率优势。
  • 随机像素采样性能劣于不确定性引导选择,尤其在添加更多标签后更为明显,凸显了智能采样策略的重要性。
  • 由于采用统一的神经场表示,iLabel生成的分割结果比同类交互系统SemanticPaint更精确、更完整。
  • 系统仅用140次点击即可实现整间房间的高精度语义网格标注,证明了其在复杂真实环境中的可扩展性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。