[论文解读] Classical Planning in Deep Latent Space
Latplan 提出了一种神经符号框架,通过从未标注的图像对(状态转移)中学习符号化的 PDDL 动作模型,利用深度潜在空间表征实现经典规划。该方法通过将图像映射到命题逻辑,在 8-数码谜题和推箱子等视觉领域实现了端到端规划,能够生成最优规划并可视化执行过程,且无需人工标注的符号或领域知识。
Current domain-independent, classical planners require symbolic models of the problem domain and instance as input, resulting in a knowledge acquisition bottleneck. Meanwhile, although deep learning has achieved significant success in many fields, the knowledge is encoded in a subsymbolic representation which is incompatible with symbolic systems such as planners. We propose Latplan, an unsupervised architecture combining deep learning and classical planning. Given only an unlabeled set of image pairs showing a subset of transitions allowed in the environment (training inputs), Latplan learns a complete propositional PDDL action model of the environment. Later, when a pair of images representing the initial and the goal states (planning inputs) is given, Latplan finds a plan to the goal state in a symbolic latent space and returns a visualized plan execution. We evaluate Latplan using image-based versions of 6 planning domains: 8-puzzle, 15-Puzzle, Blocksworld, Sokoban and Two variations of LightsOut.
研究动机与目标
- 为解决经典规划中的知识获取瓶颈,通过从原始视觉输入自动生成符号化 PDDL 模型。
- 通过构建一个将视觉观测映射到命题逻辑的神经符号系统,弥合子符号深度学习与符号规划之间的鸿沟。
- 实现在新环境中的领域无关规划,而无需事先了解对象类型、结构或动作语义。
- 评估所学习的潜在表征是否支持使用标准领域无关启发式方法进行有效且最优的规划。
- 研究在噪声或变化的视觉输入下,所学习符号的稳定性,并识别深度表示学习中导致不稳定的根源。
提出的方法
- 使用多项式二值潜在变量的离散自编码器(状态自编码器,SAE)将原始图像映射到命题符号状态表征。
- 通过具有类别潜在变量和跳跃连接的行动自编码器(AAE)对转移进行聚类,以无监督方式生成符号化动作标签。
- 反向解码模块(Back-To-Logit, BTL)直接在符号形式中建模前向动态(STRIPS 效果)和反向动态(STRIPS 前置条件)。
- 系统在未标注的有效状态转移图像对上进行端到端训练,无需监督即可学习完整的命题 PDDL 模型。
- 给定初始图像和目标图像,Latplan 使用 SAE 将状态嵌入符号逻辑,调用经典规划器,并将规划可视化为图像序列。
- 在所学习的符号空间中应用领域无关启发式方法(如 FF、IPDB),以高效引导搜索。
实验结果
研究问题
- RQ1深度学习系统能否仅从未标注的图像转移中自动学习到完整且可用的 PDDL 动作模型?
- RQ2所学习的符号化表征在无须人工标注标签的情况下,能在多大程度上支持视觉领域中的最优规划?
- RQ3在旋转、平移或风格差异等视觉变化下,所学习的符号有多稳定?
- RQ4在真实世界输入上使用随机深度神经网络进行符号接地时,导致不稳定的主因是什么?
- RQ5标准领域无关启发式方法是否能有效引导在完全由视觉数据学习的潜在空间中的搜索?
主要发现
- Latplan 在 6 个基于图像的规划领域中成功学习了符号化 PDDL 模型,包括 8-数码谜题、15-数码谜题、积木世界、推箱子,以及两个 LightsOut 变体,实现了最优规划。
- 在 8-数码谜题和积木世界等标准领域中,系统取得了高成功率,表明所学习的表征能够有效支持使用领域无关启发式方法的规划。
- 在 4 个圆盘的河内塔等复杂领域中,成功率显著下降,原因在于稀有特征(如小圆盘位于顶部区域)导致 SAE 中的数据不平衡问题。
- 研究识别出符号不稳定的两个来源:神经网络的固有随机性以及观测中的外部噪声,由此正式提出了符号稳定性问题(Symbol Stability Problem, SSP)。
- 尽管 8-数码谜题中存在旋转或平移的数字,SAE 展现出部分鲁棒性,但在高度风格化或噪声较大的输入(如餐巾上涂鸦的谜题)中失败,凸显了泛化能力的局限性。
- 在所学习的符号空间中使用标准领域无关启发式方法(如 FF、IPDB)实现了高效搜索,证实了其在自动获取表征中的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。