Skip to main content
QUICK REVIEW

[论文解读] What Should I Do Now? Marrying Reinforcement Learning and Symbolic Planning

Daniel Gordon, Dieter Fox|arXiv (Cornell University)|Jan 6, 2019
Reinforcement Learning in Robotics参考文献 35被引用 13
一句话总结

本文提出了分层规划与强化学习(HIP-RL)框架,将符号规划与深度强化学习相结合,以提升长时程视觉决策性能。通过使用规划器生成高效的动作序列,并由元控制器调用低层策略,HIP-RL在交互式问答和视觉语义规划任务中实现了最先进性能,相比纯强化学习基线方法,测试阶段步数和训练迭代次数均减少了一个数量级。

ABSTRACT

Long-term planning poses a major difficulty to many reinforcement learning algorithms. This problem becomes even more pronounced in dynamic visual environments. In this work we propose Hierarchical Planning and Reinforcement Learning (HIP-RL), a method for merging the benefits and capabilities of Symbolic Planning with the learning abilities of Deep Reinforcement Learning. We apply HIPRL to the complex visual tasks of interactive question answering and visual semantic planning and achieve state-of-the-art results on three challenging datasets all while taking fewer steps at test time and training in fewer iterations. Sample results can be found at youtu.be/0TtWJ_0mPfI

研究动机与目标

  • 解决在动态视觉环境中长期规划的挑战,其中深度强化学习因稀疏奖励和状态空间指数级增长而表现不佳。
  • 克服纯符号规划的局限性,后者需要精确的状态估计,且无法直接处理原始视觉输入。
  • 结合深度学习的特征提取优势与符号规划的结构化、目标导向推理能力,以提升样本效率和测试阶段性能。
  • 在保持或提升复杂视觉推理任务准确率的同时,减少训练时间和推理阶段的步数。
  • 通过利用规划实现一致且结构化的行为,提升智能体在未见环境中的泛化能力。

提出的方法

  • HIP-RL采用分层架构,其中元控制器选择高层动作,并调用规划器生成一系列低层动作。
  • 规划器使用Metric-FF基于从目标检测输出中提取的符号化状态表示生成完整且可执行的计划。
  • 目标检测(如Mask-RCNN)为规划器提供符号化状态输入,使其能够推理物体位置和可操作性。
  • 元控制器通过深度强化学习学习调用规划器和低层策略,使用任务完成的稀疏奖励进行训练。
  • 系统在探索(通过反应式策略)与规划(通过符号推理)之间交替,以平衡效率与完备性。
  • 当获得新观测时,规划器会被重新调用,从而实现对环境变化的动态计划更新。

实验结果

研究问题

  • RQ1符号规划能否提升深度强化学习在长时程视觉任务中的样本效率和测试阶段性能?
  • RQ2将规划与学习相结合,如何影响模型在未见环境中的泛化能力?
  • RQ3分层框架在保持或提升准确率的同时,能否减少推理阶段的步数?
  • RQ4学习得到的元控制器在多大程度上能有效协调反应式策略与符号规划器之间的协作?
  • RQ5在问答任务的早期训练阶段,规划器的使用在多大程度上缓解了学习信号矛盾的问题?

主要发现

  • HIP-RL在IQUAD V1和EQA V1上实现了最先进性能,其准确率和样本效率均优于先前方法。
  • 在IQUAD V1上,HIP-RL在120,000个分层步数内收敛至最大性能,而HIMN需500,000步且性能显著更低。
  • 在使用真实检测结果时,HIP-RL仅用26,000个分层步数即达到HIMN的最终性能,训练速度提升10倍。
  • HIP-RL通过避免冗余探索,显著减少了测试阶段的步数;在视觉语义规划任务中,其在检测到微波炉后立即找到并使用了该物体。
  • 在未见房间中的泛化能力较强:在使用真实检测结果时,IQUAD V1和VSP上的性能下降不足10%,即使对罕见物体类别的训练数据有限。
  • 当使用Mask-RCNN检测结果时,性能仍可接受,但在未见环境中差距更大,原因在于对罕见或未见的橱柜和抽屉检测失败。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。