[论文解读] SSCNav: Confidence-Aware Semantic Scene Completion for Visual Semantic Navigation
SSCNav 提出了一种置信度感知的语义场景补全模块,能够从部分 RGB-D 观测中推断完整的 3D 场景布局,利用学习到的上下文先验和不确定性估计来提升视觉语义导航性能。通过将语义补全与置信度图整合进强化学习策略中,SSCNav 相较于无场景补全的基线方法,成功率达到 5.3% 的提升,SPL 提升 3.9%,表明置信度感知的场景先验显著增强了导航的效率与鲁棒性。
This paper focuses on visual semantic navigation, the task of producing actions for an active agent to navigate to a specified target object category in an unknown environment. To complete this task, the algorithm should simultaneously locate and navigate to an instance of the category. In comparison to the traditional point goal navigation, this task requires the agent to have a stronger contextual prior to indoor environments. We introduce SSCNav, an algorithm that explicitly models scene priors using a confidence-aware semantic scene completion module to complete the scene and guide the agent's navigation planning. Given a partial observation of the environment, SSCNav first infers a complete scene representation with semantic labels for the unobserved scene together with a confidence map associated with its own prediction. Then, a policy network infers the action from the scene completion result and confidence map. Our experiments demonstrate that the proposed scene completion module improves the efficiency of the downstream navigation policies. Video, code, and data: https://sscnav.cs.columbia.edu/
研究动机与目标
- 通过利用部分观测之外的上下文先验,提升在未知室内环境中视觉语义导航的性能。
- 解决在仅有部分遮挡视图时导航至目标物体类别所面临的挑战。
- 通过显式建模场景补全预测中的不确定性,提升导航规划能力。
- 证明置信度感知的场景补全可带来更高效、更可靠的导航策略。
- 验证密集空间动作图相较于稀疏动作表示在导航任务中的优越性。
提出的方法
- 该方法使用一种置信度感知的语义场景补全模块,从部分 RGB-D 观测中预测完整的 3D 场景布局(俯视图地图)。
- 该补全模块同时生成语义标签与密集置信度图,通过自监督的置信度预测方法估计每个像素的不确定性。
- 一个深度强化学习策略将补全后的语义地图与置信度图作为输入,通过密集空间动作图生成动作。
- 空间动作图将动作表示为朝向地图中每个像素的移动,从而实现细粒度、与规划对齐的导航决策。
- 系统通过课程学习与基于课程的探索策略,采用端到端的深度强化学习进行训练。
- 消融研究通过 [SSCNav-CF]、[SSCNav/SA] 和 [SSCNav/BC] 等变体,比较了置信度估计、场景补全与动作表示的影响。
实验结果
研究问题
- RQ1与标准场景补全相比,置信度感知的语义场景补全是否能提升视觉语义导航性能?
- RQ2场景补全中的不确定性估计如何影响导航策略的可靠性与成功率?
- RQ3使用密集空间动作图与稀疏动作表示相比,对导航效率有何影响?
- RQ4来自场景补全的上下文先验在导航具有强空间偏置的物体(如马桶)时,能发挥多大作用?
- RQ5当提供真实分割结果时,模型表现如何?场景补全是否仍具有优势?
主要发现
- SSCNav 相较于基线方法 [SSCNav-CF],成功率提升 5.3%,SPL 提升 3.9%,表明置信度感知补全显著提升了导航性能。
- 置信度感知模块使策略能够更好地处理场景补全中的错误,尤其在具有强上下文先验的物体(如马桶)上表现更优。
- 即使提供真实分割结果,SSCNav 仍优于基于真实分割的最优基线(oracle baseline),表明场景补全的价值超越了精确感知本身。
- 与稀疏动作表示相比,密集空间动作图表示使成功率提升 16.2%,SPL 提升 14.8%,证实其在规划中的优越性。
- SSCNav 学习到的置信度图优于基于可见性的简单二值置信度掩码,使成功率提升 1.9%,SPL 提升 0.7%。
- 对于沙发和桌子等常见物体,由于其上下文偏置较弱,场景补全的增益降低,但置信度估计仍能提升策略鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。