Skip to main content
QUICK REVIEW

[论文解读] PDDLGym: Gym Environments from PDDL Problems

Tom Silver, Rohan Chitnis|arXiv (Cornell University)|Feb 15, 2020
Software Engineering Research参考文献 25被引用 10
一句话总结

PDDLGym 是一个开源框架,可从 PDDL 域和问题文件自动生成 OpenAI Gym 环境,支持关系强化学习与顺序决策研究。它支持多样且可定制的基准测试,内置环境涵盖从 Sokoban 到 TSP 的多种任务,展示了规划与模型学习难度的显著差异。

ABSTRACT

We present PDDLGym, a framework that automatically constructs OpenAI Gym environments from PDDL domains and problems. Observations and actions in PDDLGym are relational, making the framework particularly well-suited for research in relational reinforcement learning and relational sequential decision-making. PDDLGym is also useful as a generic framework for rapidly building numerous, diverse benchmarks from a concise and familiar specification language. We discuss design decisions and implementation details, and also illustrate empirical variations between the 20 built-in environments in terms of planning and model-learning difficulty. We hope that PDDLGym will facilitate bridge-building between the reinforcement learning community (from which Gym emerged) and the AI planning community (which produced PDDL). We look forward to gathering feedback from all those interested and expanding the set of available environments and features accordingly. Code: https://github.com/tomsilver/pddlgym

研究动机与目标

  • 通过统一 Gym 与 PDDL,弥合强化学习(RL)与经典 AI 规划之间的差距。
  • 使研究人员能够使用标准化的符号规范语言,快速创建并比较关系顺序决策的基准测试。
  • 通过允许 RL 与规划研究者在相同且明确定义的环境中评估方法,促进跨社区研究。
  • 通过统一且可扩展的框架,支持关系强化学习、层次化策略学习与状态抽象的高级研究。
  • 为学习符号化转移模型并从交互数据中发现关系结构提供基础。

提出的方法

  • 使用 Python 库,自动从 PDDL 域和问题文件构建 Gym 环境。
  • 将观测表示为一组实例化的关系谓词(例如,on(plate, table)),将动作表示为实例化的操作符模板(例如,pick(plate))。
  • 在环境端实现 Gym 的标准 API(step、reset、action_space、observation_space),并基于 PDDL 定义的转移模型。
  • 为 20 个内置领域中的 11 个支持自定义渲染,以提升可视化与可解释性。
  • 使用快速前向规划与 FOLDT 学习,评估各环境中的规划与模型学习难度。
  • 通过基于 URL 的加载方式,支持与外部 PDDL 代码库集成,提升可扩展性与社区贡献能力。

实验结果

研究问题

  • RQ1如何系统性地将基于 PDDL 的规划问题转化为适用于强化学习研究的标准化 Gym 环境?
  • RQ2基于 PDDL 的环境在规划难度与模型学习复杂度方面有多大差异?
  • RQ3PDDLGym 是否可作为通用基准平台,统一并加速关系强化学习与符号规划的研究?
  • RQ4在关系环境中,从交互数据中学习准确转移模型面临哪些挑战?
  • RQ5PDDLGym 如何支持层次化、目标条件化与提升式策略学习方法的开发?

主要发现

  • 20 个内置的 PDDLGym 环境在规划难度上表现出显著差异,其中 Depot 域的规划时间比 TSP 域高出两个数量级。
  • 快速前向规划时间从 TSP 的 1 秒以下到 Depot 的 1000 秒以上,表明问题复杂度跨度极大。
  • 模型学习难度差异显著:FOLDT 学习在 5 个领域中成功,但在 Baking、Depot 和 Sokoban 等领域内未能在合理时间内收敛。
  • 各环境的平均帧率(FPS)从 Sokoban 的 155 到 TSP 的 1688 不等,表明在随机策略下性能存在显著差异。
  • 为 20 个领域中的 11 个实现了自定义渲染,显著提升了研究与调试过程中的可视化与可解释性。
  • 实证结果表明,即使“简单”的领域如 TSP 和 Blocks 对学习仍构成非平凡挑战,例如操作符发现与状态抽象。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。