Skip to main content
QUICK REVIEW

[论文解读] Reinforcement Learning for Semantic Segmentation in Indoor Scenes

Md. Alimoor Reza, Jana Košecká|arXiv (Cornell University)|Jun 3, 2016
Advanced Neural Network Applications参考文献 21被引用 10
一句话总结

本文提出一种基于强化学习的方法,通过学习一种序列策略来组合独立的二值对象-背景分割,实现在NYU-V2数据集上与最先进方法相当的语义分割性能,同时为机器人应用提供模块化、任务特定和增量学习的能力。

ABSTRACT

Future advancements in robot autonomy and sophistication of robotics tasks rest on robust, efficient, and task-dependent semantic understanding of the environment. Semantic segmentation is the problem of simultaneous segmentation and categorization of a partition of sensory data. The majority of current approaches tackle this using multi-class segmentation and labeling in a Conditional Random Field (CRF) framework or by generating multiple object hypotheses and combining them sequentially. In practical settings, the subset of semantic labels that are needed depend on the task and particular scene and labelling every single pixel is not always necessary. We pursue these observations in developing a more modular and flexible approach to multi-class parsing of RGBD data based on learning strategies for combining independent binary object-vs-background segmentations in place of the usual monolithic multi-label CRF approach. Parameters for the independent binary segmentation models can be learned very efficiently, and the combination strategy---learned using reinforcement learning---can be set independently and can vary over different tasks and environments. Accuracy is comparable to state-of-art methods on a subset of the NYU-V2 dataset of indoor scenes, while providing additional flexibility and modularity.

研究动机与目标

  • 通过支持任务特定和增量标签选择,解决单体多类别CRF模型在语义分割中的刚性问题。
  • 通过将分割解耦为独立的二值预测,实现在机器人应用中模块化和自适应的语义理解。
  • 开发一种灵活的框架,支持终身学习和对新语义概念的动态适应,而无需重新训练整个模型。
  • 通过使用序列策略学习而非联合多类别CRF优化,简化训练和推理,提升优化效率。
  • 通过利用结合几何和外观线索的多样化超像素,提升室内场景中区域表示的质量,从而改善性能。

提出的方法

  • 将二值分割的序列组合建模为马尔可夫决策过程(MDP),其中每个动作对应于选择并分割一个对象类别。
  • 使用最小二乘策略迭代(LSPI)算法,学习一种策略,以在推理过程中最大化密集像素级Jaccard指数的奖励信号。
  • 生成多样化超像素:通过RGB-D数据的几何拟合生成大平面区域,通过基于外观的聚类生成小而紧凑的区域。
  • 使用像素级注释数据,通过监督学习训练每个对象类别的独立二值分割模型。
  • 使用学习到的策略按顺序组合分割结果,每一步通过置信度加权融合来优化当前分割图。
  • 使用时序差分学习端到端优化策略,其中奖励计算为最终分割结果与真实标签之间的Jaccard指数。

实验结果

研究问题

  • RQ1所学习的二值分割序列策略是否能在语义分割精度上与最先进多类别CRF方法相媲美?
  • RQ2独立二值分割与基于策略的组合相结合的模块化方法,是否能实现对标签子集的任务特定更好适应性?
  • RQ3结合几何和外观线索的多样化超像素,对室内场景中的分割性能有何影响?
  • RQ4强化学习能否有效学习复杂室内环境中对象选择与分割的最优序列?
  • RQ5所提方法在无需重新训练整个模型的前提下,对新语义概念的增量和终身学习支持程度如何?

主要发现

  • 所提方法在NYU-V2数据集上表现具有竞争力,'客厅'场景的平均Jaccard指数达到68.0%,与Gupta等人[9]等最先进方法相当。
  • 在'厨房'场景中,'床'的Jaccard指数达到60.5%,'灯'达到34.8%,表明对常见室内物体具有优异性能。
  • LSPI学习到的策略优于固定顺序和随机顺序基线,接近通过枚举全部120种排列(5个对象)找到的最优组合性能。
  • 在客厅场景中,'地板'的Jaccard指数达到81.3%,'墙'达到68.0%,表明在大平面表面上表现强劲。
  • 使用多样化超像素显著提升了分割精度,有效捕捉了大尺度结构表面和小而紧凑的物体。
  • 模块化设计支持仅关注相关标签的任务特定分割,而不会损害性能,从而支持灵活且自适应的机器人感知。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。