QUICK REVIEW
[论文解读] Constructing Abstraction Hierarchies Using a Skill-Symbol Loop
George Konidaris|PubMed|Sep 25, 2015
Reinforcement Learning in Robotics参考文献 7被引用 6
一句话总结
本文提出了一种技能-符号循环框架,通过交替获取高层技能和构建符号表示,构建兼具时间抽象和状态抽象的分层MDP。通过迭代优化技能及其对应的符号抽象,该方法实现了多任务中的高效规划,在Taxi领域中,通过抽象状态空间和动作序列,显著降低了规划复杂度。
ABSTRACT
We describe a framework for building abstraction hierarchies whereby an agent alternates skill- and representation-construction phases to construct a sequence of increasingly abstract Markov decision processes. Our formulation builds on recent results showing that the appropriate abstract representation of a problem is specified by the agent's skills. We describe how such a hierarchy can be used for fast planning, and illustrate the construction of an appropriate hierarchy for the Taxi domain.
研究动机与目标
- 为解决在连续、高维域中高层决策与低层动作及感知之间的关联问题。
- 克服现有分层强化学习方法在获取技能后仍保留原始低层状态空间的局限性。
- 自动化构建抽象层次结构,使得每一层的 state space 和可用动作集均变得更抽象。
- 证明适当的符号表示由智能体可获取的技能决定,从而实现动态层次结构的形成。
- 通过利用从技能中衍生的分层抽象,实现在多任务强化学习中的快速、可扩展规划。
提出的方法
- 该框架在技能获取阶段(发现新的选项(宏动作))与表示获取阶段(构建符号抽象)之间交替进行。
- 符号表示通过将符号映射到状态集合的接地分类器来定义,逻辑运算保持语义一致性。
- 在层次结构的每一层,基于该层可用的技能对状态空间进行抽象,形成一系列逐渐更抽象的 SMDP。
- 智能体在最高层进行规划,当目标与状态抽象匹配时;若不成功,则回退至较低层。
- 该方法使用动态规划进行规划,使用决策树评估接地分类器。
- 层次结构通过迭代构建:首先获取技能(例如,在Taxi领域中为‘接载/卸载’),然后基于这些技能形成符号状态。
实验结果
研究问题
- RQ1如何自动构建抽象层次结构,使得每一层的 state space 和 action set 均变得更抽象?
- RQ2智能体可获取的技能与其用于规划的适当符号表示之间存在何种关系?
- RQ3技能获取与表示构建的循环能否形成真正的层次结构,从而实现在多任务中的更快规划?
- RQ4在何种场景下,该层次结构无法提升规划性能?原因是什么?
- RQ5如何对符号抽象进行接地,以保持语义一致性并支持高效规划?
主要发现
- 该框架在Taxi领域成功构建了三层抽象层次结构,分别为M2(如‘乘客至红色’的宏动作)、M1(粗粒度状态抽象)和M0(原始动作)。
- 在示例查询1中,由于M2层具备足够的符号抽象,规划在M2层成功完成,仅需在4个状态的图中生成平凡计划。
- 在示例查询2中,M2层因状态具体性不足(无法准确表示出租车位置)而失败,需回退至M1层进行规划。
- 在示例查询3中,M2和M1层均无法表示乘客位于非车站位置的状态,因此必须进行完整的M0层规划。
- 结果表明,仅当符号抽象与问题目标结构相匹配时,该层次结构才能提供性能优势,凸显了以技能驱动的表示设计的重要性。
- 该框架表明,技能获取与符号表示具有相互依赖性:技能决定了适当的抽象方式,而新技能的出现则要求新的表示。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。