Skip to main content
QUICK REVIEW

[论文解读] Value Function Spaces: Skill-Centric State Abstractions for Long-Horizon Reasoning

Dhruv Shah, Peng Xu|arXiv (Cornell University)|Nov 4, 2021
Reinforcement Learning in Robotics被引用 9
一句话总结

本文提出了价值函数空间(VFS),一种以技能为中心的状态抽象方法,利用低层技能的价值函数构建环境的紧凑且不变的表示。通过基于技能可操作性的状态编码,VFS 提升了长时程强化学习的性能,并实现了强大的零样本泛化能力,在迷宫求解和机器人操作任务中优于对比学习与信息论方法。

ABSTRACT

Reinforcement learning can train policies that effectively perform complex tasks. However for long-horizon tasks, the performance of these methods degrades with horizon, often necessitating reasoning over and chaining lower-level skills. Hierarchical reinforcement learning aims to enable this by providing a bank of low-level skills as action abstractions. Hierarchies can further improve on this by abstracting the space states as well. We posit that a suitable state abstraction should depend on the capabilities of the available lower-level policies. We propose Value Function Spaces: a simple approach that produces such a representation by using the value functions corresponding to each lower-level skill. These value functions capture the affordances of the scene, thus forming a representation that compactly abstracts task relevant information and robustly ignores distractors. Empirical evaluations for maze-solving and robotic manipulation tasks demonstrate that our approach improves long-horizon performance and enables better zero-shot generalization than alternative model-free and model-based methods.

研究动机与目标

  • 为解决在具有丰富观测的长时程任务中,分层强化学习(HRL)中的状态抽象挑战。
  • 开发一种对干扰因素和外生因素保持不变,同时保留可用技能任务相关可操作性的状态表示。
  • 通过构建一个功能性的、技能感知的嵌入空间,提升高层策略的泛化与规划能力。
  • 证明低层技能的价值函数可作为高层规划中有效、紧凑且鲁棒的表示。
  • 展示 VFS 在复杂环境中与基于模型和无模型的高层策略的兼容性。

提出的方法

  • VFS 通过拼接给定观测下所有可用低层技能的价值函数来构建状态表示。
  • 价值函数编码了每项技能的预期回报,捕捉其在当前状态下的可操作性与前置条件。
  • 该表示对任务无关因素(如物体颜色、背景纹理和机械臂姿态)保持不变,同时保留功能状态等价性。
  • 该方法与基于模型和无模型的规划均兼容,无需修改现有 HRL 流程。
  • 该方法利用价值函数的内在特性,在统一的嵌入空间中建模技能的可能结果与已完成结果。
  • 该表示在训练过程中端到端学习,并作为高层策略决策的输入。

实验结果

研究问题

  • RQ1低层技能的价值函数能否作为功能性、以技能为中心的状态表示,捕捉可操作性并忽略干扰因素?
  • RQ2基于技能价值函数的表示是否能提升复杂环境中长时程任务的性能?
  • RQ3VFS 是否能在无需微调的情况下实现对新环境的零样本泛化?
  • RQ4在规划效率与成功率方面,VFS 与对比学习和信息论表示学习方法相比表现如何?
  • RQ5VFS 表示是否与基于模型和无模型的高层策略均兼容?

主要发现

  • 在 O5 机器人操作任务中,VFS 达到 100% 的成功率,与最优基准(oracle)性能一致,并优于所有基线方法。
  • 在更具挑战性的 O10 任务中,VFS 达到 80% 的成功率,接近最优基准的 85% 性能。
  • VFS 显著优于 VAE 和 CPC 表示方法,后者在 O10 设置下成功率分别降至 30% 和 40%。
  • VFS 嵌入的 t-SNE 可视化显示,对应于功能状态(如机械臂抓取不同物体)的清晰聚类,同时忽略臂部姿态或背景等无关变化。
  • VFS 展现出强大的零样本泛化能力,在无需微调的情况下成功泛化至新环境。
  • 该方法在基于模型和无模型的规划设置中均表现有效,显示出与现有 HRL 框架的广泛兼容性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。