Skip to main content
QUICK REVIEW

[论文解读] Learning Action Models from Disordered and Noisy Plan Traces

Hankz Hankui Zhuo, Jing Peng|arXiv (Cornell University)|Aug 26, 2019
Robot Manipulation and Learning参考文献 30被引用 5
一句话总结

该论文提出AMDN,一种基于MAX-SAT的框架,能够从包含无序动作、并行动作和噪声状态的计划轨迹中学习准确的动作模型——这些特征在真实世界数据(如自然语言或监控日志)中普遍存在。通过构建专门的无序、并行和噪声约束,并根据其可能性进行加权,AMDN在合成数据和真实世界领域中均优于先前方法(ARMS、AMAN),在噪声和无序环境下表现出更强鲁棒性,且计算复杂度随输入规模呈多项式增长。

ABSTRACT

There is increasing awareness in the planning community that the burden of specifying complete domain models is too high, which impedes the applicability of planning technology in many real-world domains. Although there have many learning systems that help automatically learning domain models, most existing work assumes that the input traces are completely correct. A more realistic situation is that the plan traces are disordered and noisy, such as plan traces described by natural language. In this paper we propose and evaluate an approach for doing this. Our approach takes as input a set of plan traces with disordered actions and noise and outputs action models that can best explain the plan traces. We use a MAX-SAT framework for learning, where the constraints are derived from the given plan traces. Unlike traditional action models learners, the states in plan traces can be partially observable and noisy as well as the actions in plan traces can be disordered and parallel. We demonstrate the effectiveness of our approach through a systematic empirical evaluation with both IPC domains and the real-world dataset extracted from natural language documents.

研究动机与目标

  • 解决从因数据收集不完善而常出现无序、并行或噪声状态的真实世界计划轨迹中学习领域动作模型的挑战。
  • 开发一种方法,能够在不假设计划轨迹完全有序或干净的前提下,有效学习动作模型,这在实际应用中更为常见。
  • 通过在MAX-SAT框架中对约束进行加权,显式建模不确定性,从而提升对噪声和无序的鲁棒性。
  • 在标准IPC规划领域和从自然语言文档中提取的真实世界数据集上对方法进行评估。

提出的方法

  • 该方法构建三类约束:无序约束用于建模非顺序的动作顺序,并行约束用于捕捉并发动作,噪声约束用于处理部分可观察或错误的状态。
  • 约束以与无序或噪声发生概率估计成比例的权重进行编码,使MAX-SAT求解器能够优先处理更可靠的信息。
  • 使用加权MAX-SAT求解器寻找满足最多约束的一致动作模型集合,从而最小化来自噪声或无序输入的冲突。
  • 将求解结果转换为STRIPS风格的动作模型,表示前提条件和效果。
  • 通过在具有可控无序和噪声水平的合成计划轨迹,以及从自然语言教程中提取的真实世界轨迹上进行评估,验证该框架。

实验结果

研究问题

  • RQ1当计划轨迹中包含无序和并行动作时,基于MAX-SAT的方法在学习动作模型方面的表现如何?
  • RQ2与忽略噪声或无序的方法相比,所提出的约束加权方案是否能提升对噪声状态的鲁棒性?
  • RQ3在不同无序和噪声水平下,AMDN与ARMS和AMAN的模型学习准确率相比如何?
  • RQ4随着计划轨迹数量的增加,AMDN的性能是否提升?其运行时间如何随规模扩展?

主要发现

  • 在真实世界CookingTutorial数据集上,AMDN的准确率显著高于ARMS和AMAN,400条轨迹下达到88.2%,而ARMS和AMAN分别为73.2%和75.6%。
  • AMDN在无序情况下的鲁棒性更优:随着无序概率上升,其准确率下降速度慢于ARMS和AMAN,归因于对动作顺序不确定性的显式建模。
  • AMDN对噪声也更具韧性:随着噪声水平上升,其准确率始终高于AMAN和ARMS,得益于加权约束对不可靠观测的弱化处理。
  • AMDN的运行时间随输入计划轨迹数量呈多项式增长,在blocksworld领域中拟合的多项式为$0.3845x^{2}+4.837x-15.32$,表明其具有可扩展的性能。
  • AMDN的准确率随计划轨迹数量增加而提升,证实了在噪声和无序环境下,更多数据有助于提升模型学习效果。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。