Skip to main content
QUICK REVIEW

[论文解读] Efficient, Safe, and Probably Approximately Complete Learning of Action Models

Roni Stern, Brendan Juba|arXiv (Cornell University)|May 24, 2017
Machine Learning and Algorithms被引用 4
一句话总结

本文提出一种保守的、基于模型的方法,仅使用成功轨迹实现安全的无模型规划,通过约束先决条件和效果来学习动作。证明了在观察到的轨迹数量增加时,失败概率呈准线性下降,实现了可靠、高效且可能近似完备的规划,且不会发生执行失败。

ABSTRACT

In this paper we explore the theoretical boundaries of planning in a setting where no model of the agent's actions is given. Instead of an action model, a set of successfully executed plans are given and the task is to generate a plan that is safe, i.e., guaranteed to achieve the goal without failing. To this end, we show how to learn a conservative model of the world in which actions are guaranteed to be applicable. This conservative model is then given to an off-the-shelf classical planner, resulting in a plan that is guaranteed to achieve the goal. However, this reduction from a model-free planning to a model-based planning is not complete: in some cases a plan will not be found even when such exists. We analyze the relation between the number of observed plans and the likelihood that our conservative approach will indeed fail to solve a solvable problem. Our analysis show that the number of trajectories needed scales gracefully.

研究动机与目标

  • 解决在缺乏先验动作模型的环境中进行规划的挑战,其中执行失败是不可接受的。
  • 开发一种仅使用观察到的成功轨迹来生成保证成功的计划的方法。
  • 通过学习保守的动作模型,确保规划过程高效且避免试错。
  • 基于观察到的轨迹数量,提供成功可能性的理论保证。
  • 在保持可靠性与效率的同时,放宽完备性要求,以适应高成本或受限执行环境下的实际应用。

提出的方法

  • 仅通过观察成功轨迹来学习动作模型,通过边界限定每个动作的可能先决条件和效果。
  • 构建一个保守的动作模型,其中包含所有观察到的先决条件和效果,且不作任何额外假设。
  • 使用标准规划形式化方法(如SAS+)将学习到的保守模型转换为经典规划问题。
  • 在保守模型上使用现成的经典规划器,生成保证成功的计划。
  • 应用概率近似正确(PAC)学习框架,分析基于轨迹数量的失败可能性。
  • 在较温和的假设下,证明失败概率随观察到的轨迹数量增加呈准线性下降。

实验结果

研究问题

  • RQ1我们能否仅从成功轨迹中学习到安全且保守的动作模型,而无需任何失败反馈?
  • RQ2观察到的轨迹数量如何影响成功找到有效计划的概率?
  • RQ3是否可能在不完全完备的情况下实现可靠规划,同时保持效率并避免执行失败?
  • RQ4该方法能提供哪些关于成功可能性的理论保证?
  • RQ5与依赖正负样本的现有模型学习方法相比,该方法有何不同?

主要发现

  • 所提方法具有可靠性:从学习到的保守模型生成的任何计划,在原始无模型设置中都保证成功。
  • 该方法高效,利用现有经典规划器对编译后的保守动作模型进行处理。
  • 无法找到计划的情况仅在保守模型排除了必要动作时发生,而这种情况随着轨迹数量增加而变得越来越不可能。
  • 在对领域和动作结构作较温和假设的前提下,失败概率随观察到的轨迹数量呈准线性下降。
  • 该方法在无模型设置下实现了概率近似完备(PAC)学习,而以往方法通常需要失败反馈或计算上不可行。
  • 通过仅关注学习足够用于安全规划的模型,该方法避免了学习精确模型或策略的计算复杂性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。