Skip to main content
QUICK REVIEW

[论文解读] STRIPS Action Discovery

Alejandro Muchada Suárez, Javier Segovia‐Aguas|arXiv (Cornell University)|Jan 30, 2020
AI-based Problem Solving and Planning参考文献 31被引用 5
一句话总结

该论文提出了一种无监督算法 UDAM,仅通过初始状态和目标状态,利用经典规划器将任务编译为 PDDL,从而合成 Strips 动作模型——包括动作签名、前提条件和效果。该方法通过移除前提条件而非显式编程来学习静态谓词,并在 IPC 基准测试中对未见过的规划实例表现出高成功率的泛化能力。

ABSTRACT

The problem of specifying high-level knowledge bases for planning becomes a hard task in realistic environments. This knowledge is usually handcrafted and is hard to keep updated, even for system experts. Recent approaches have shown the success of classical planning at synthesizing action models even when all intermediate states are missing. These approaches can synthesize action schemas in Planning Domain Definition Language (PDDL) from a set of execution traces each consisting, at least, of an initial and final state. In this paper, we propose a new algorithm to unsupervisedly synthesize STRIPS action models with a classical planner when action signatures are unknown. In addition, we contribute with a compilation to classical planning that mitigates the problem of learning static predicates in the action model preconditions, exploits the capabilities of SAT planners with parallel encodings to compute action schemas and validate all instances. Our system is flexible in that it supports the inclusion of partial input information that may speed up the search. We show through several experiments how learned action models generalize over unseen planning instances.

研究动机与目标

  • 为解决在复杂环境中手动构建高层规划知识库所面临的错误频发且难以维护的挑战。
  • 实现在仅可观测到初始状态和目标状态时,无监督学习完整的 Strips 动作模式——包括动作签名、前提条件和效果。
  • 通过从前提条件中移除静态谓词而非显式编码,缓解学习静态谓词的困难。
  • 利用部分先验知识并结合新实例的验证,支持对动作模型的增量式优化。
  • 评估在输入示例数量不断增加的情况下,所学动作模型的泛化能力与收敛性。

提出的方法

  • 将动作学习任务编译为 PDDL 中的经典规划问题,利用基于 SAT 的规划器从输入规划实例中推断动作模式。
  • 采用一种新颖的编译策略,将静态谓词视为可移除的前提条件而非固定组成部分,从而减少对手动指定的需求。
  • 生成并行验证实例,以同时在多个输入示例上测试所学动作模型。
  • 使用配置算法探索有界搜索空间以支持学习任务,提升效率与收敛性。
  • 应用一种无监督学习算法(UDAM),其无需动作签名、动作名称或中间状态信息即可运行。
  • 通过在动作结构上施加结构化约束,将学习任务编码为规划问题,从而复用现成的经典规划器。

实验结果

研究问题

  • RQ1是否能够仅从初始状态和目标状态学习 Strips 动作模型,而无需任何动作签名或中间状态信息?
  • RQ2如何在不将静态谓词硬编码到前提条件中的情况下,有效学习静态谓词?
  • RQ3所学动作模型在多大程度上能泛化到新的、未见过的规划实例?
  • RQ4包含部分先验知识在多大程度上影响学习收敛性与模型质量?
  • RQ5所提出的编译方法是否能在学习正确且可泛化的动作模式方面实现高成功率?

主要发现

  • 所提方法成功地仅基于初始状态和目标状态学习了完整的 Strips 动作模型——包括动作签名、前提条件和效果,且无需中间状态或动作名称信息。
  • 该方法在未见过的规划实例上表现出良好的泛化能力,所有理论上可解的测试案例均被所学模型成功求解。
  • 随着输入示例数量的增加,模型学习表现出高收敛性,表明学习行为稳定。
  • 通过从前提条件中移除静态谓词来学习静态谓词,减少了对手动指定的需求,并提升了模型鲁棒性。
  • 采用并行实例的验证框架,证实了所学动作模型在多样化输入下的一致性与正确性。
  • 该算法在标准 IPC 基准测试中表现出色,在泛化能力和学习完备性方面优于先前方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。