Skip to main content
QUICK REVIEW

[论文解读] Learning Neural-Symbolic Descriptive Planning Models via Cube-Space Priors: The Voyage Home (to STRIPS)

Masataro Asai, Christian Muise|arXiv (Cornell University)|Apr 27, 2020
AI-based Problem Solving and Planning参考文献 48被引用 15
一句话总结

该论文提出了一种神经符号框架——立方体空间自编码器(Cube-Space AutoEncoder, Cube-Space AE),该框架能够以端到端、无监督的方式,直接从原始视觉输入中学习紧凑且描述性强的STRIPS风格规划模型。通过在潜在状态空间中施加类似立方体的图先验,该方法实现了符号化动作效应的高效提取,并生成可被现成规划器使用的PDDL兼容模型,在未见过的15-Puzzle实例上实现了强大的泛化能力,且无需强化学习或领域特定奖励信号。

ABSTRACT

We achieved a new milestone in the difficult task of enabling agents to learn about their environment autonomously. Our neuro-symbolic architecture is trained end-to-end to produce a succinct and effective discrete state transition model from images alone. Our target representation (the Planning Domain Definition Language) is already in a form that off-the-shelf solvers can consume, and opens the door to the rich array of modern heuristic search capabilities. We demonstrate how the sophisticated innate prior we place on the learning process significantly reduces the complexity of the learned representation, and reveals a connection to the graph-theoretic notion of "cube-like graphs", thus opening the door to a deeper understanding of the ideal properties for learned symbolic representations. We show that the powerful domain-independent heuristics allow our system to solve visual 15-Puzzle instances which are beyond the reach of blind search, without resorting to the Reinforcement Learning approach that requires a huge amount of training on the domain-dependent reward information.

研究动机与目标

  • 为解决从非结构化视觉输入中学习符号化、描述性转移模型的挑战,且不依赖人工定义的符号或奖励信号。
  • 通过基于类似立方体图的几何先验,降低所学动作模型的复杂度,使其与STRIPS语义相一致。
  • 通过从原始图像数据生成可落地的PDDL表示,实现与现成经典规划器的直接集成。
  • 在无需强化学习的情况下,实现对视觉规划领域中未见过状态的强零样本泛化能力,例如15-Puzzle。
  • 证明领域无关启发式方法(如h^LMcut)可在完全从视觉观测中自动获取的符号表示中有效引导规划,即使训练数据中不包含解状态。

提出的方法

  • 立方体空间自编码器(Cube-Space AE)联合训练编码器与解码器,将视觉观测映射到一个离散、低维的潜在空间,该空间被结构化为有向的类似立方体的图。
  • 该架构施加了一种类立方体图的几何先验,限制潜在空间同构于一个有向超立方体,从而确保动作效应可表示为简单的位翻转操作。
  • 通过识别潜在状态中的一致性变化,从学习到的转移动态中推导出动作模型,进而映射为STRIPS风格的前置条件、添加效应和删除效应。
  • Back-to-Logit(BtL)模块通过近似直通梯度,实现对离散潜在变量的可微训练,从而支持端到端反向传播。
  • 系统输出包含学习到的动作模型的PDDL领域与问题文件,可被Fast Downward等经典规划器直接消费,并支持h^LMcut启发式方法。
  • 该方法采用图像转移对的对比学习目标来训练自编码器,确保潜在空间能够捕捉环境的真实动力学。

实验结果

研究问题

  • RQ1神经网络能否在无需人工定义符号或奖励设计的情况下,直接从原始视觉输入中学习到紧凑且描述性强的STRIPS风格动作模型?
  • RQ2在潜在空间中强制施加类似立方体的图结构,是否能显著简化并提升动作模型的可解释性,相较于无约束表示?
  • RQ3由此产生的符号化模型能否泛化到训练数据中未出现过的解路径,特别是在15-Puzzle等复杂领域?
  • RQ4领域无关启发式方法(如h^LMcut)在完全从视觉观测中学习到的符号化模型中,能在多大程度上有效引导规划?
  • RQ5与需要密集奖励信号的强化学习方法相比,该方法在样本效率和规划性能方面表现如何?

主要发现

  • 系统成功从15-Puzzle状态的原始图像中生成PDDL模型,使现成规划器能够求解原本超出盲目搜索能力的实例。
  • 最优解路径中的绝大多数状态在训练过程中均未出现,证明了对未见状态配置的强零样本泛化能力。
  • 该方法在无需任何强化学习或奖励设计的情况下实现规划成功,完全依赖于类似立方体的潜在空间结构和领域无关启发式方法。
  • 类似立方体的图先验使得动作模型极为紧凑,避免了黑盒神经模型中常见的基于实例的动作表示的指数级膨胀。
  • Back-to-Logit(BtL)模块实现了对离散潜在变量的有效端到端训练,使整个系统可微分且可在单一流水线中训练。
  • 该框架表明,对潜在空间施加几何先验,可产生既可解释又适用于经典规划的有效符号化表示。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。