Skip to main content
QUICK REVIEW

[论文解读] Discovering Underlying Plans Based on Distributed Representations of Actions

Xin Tian, Hankz Hankui Zhuo|arXiv (Cornell University)|Nov 18, 2015
AI-based Problem Solving and Planning参考文献 21被引用 7
一句话总结

本文提出DUP,一种新颖的计划识别方法,通过跳字模型从计划语料库中学习动作的分布式向量表示,从而在无需完整领域模型或计划库的情况下识别未观察到或未见过的计划。该方法通过动作向量上的期望最大化算法推断可能的未观察到的动作,在三个领域中表现优于传统方法,有效捕捉了有限数据中的计划结构。

ABSTRACT

Plan recognition aims to discover target plans (i.e., sequences of actions) behind observed actions, with history plan libraries or domain models in hand. Previous approaches either discover plans by maximally "matching" observed actions to plan libraries, assuming target plans are from plan libraries, or infer plans by executing domain models to best explain the observed actions, assuming complete domain models are available. In real world applications, however, target plans are often not from plan libraries and complete domain models are often not available, since building complete sets of plans and complete domain models are often difficult or expensive. In this paper we view plan libraries as corpora and learn vector representations of actions using the corpora; we then discover target plans based on the vector representations. Our approach is capable of discovering underlying plans that are not from plan libraries, without requiring domain models provided. We empirically demonstrate the effectiveness of our approach by comparing its performance to traditional plan recognition approaches in three planning domains.

研究动机与目标

  • 解决传统计划识别方法需要完整领域模型或预先存在的计划库的局限性。
  • 实现在领域模型不完整或不可用的人机协同场景中的计划识别。
  • 开发一种可扩展的、数据驱动的方法,从历史计划序列中学习动作的浅层分布式表示。
  • 通过基于学习到的动作语义建议可能的下一步动作,支持实时决策支持。
  • 证明基于向量的动作表示能够有效建模计划结构,并在未见计划上提高识别准确率。

提出的方法

  • 该方法将计划库视为语料库,并应用跳字模型从动作序列中学习动作的稠密向量表示。
  • 通过学习到的向量空间将每个未观察到的动作建模为可能动作的分布,以捕捉语义和序列上下文。
  • 使用期望最大化算法,通过最大化观察到计划的似然性,联合推断最可能的未观察到动作序列。
  • 该方法不依赖预条件-效果模型或形式化领域模型,而是从原始动作序列中学习。
  • 通过基于向量相似性和上下文似然性的候选动作排序,支持计划补全。
  • 该框架设计为增量式,支持人机协同的迭代式计划优化。

实验结果

研究问题

  • RQ1从计划语料库中学习到的动作分布式表示是否能有效支持计划识别,而无需完整领域模型?
  • RQ2基于向量的模型在识别原始计划库中不存在的未观察到或未见计划方面表现如何?
  • RQ3所提出的方法是否能优于依赖STRIPS风格模型或计划库匹配的传统计划识别技术?
  • RQ4所学习的向量空间在多大程度上捕捉了动作序列中的有意义序列和语义结构?
  • RQ5该方法在实时、交互式计划场景中建议正确下一步动作的有效性如何?

主要发现

  • DUP方法成功识别出原始计划库中不存在的潜在计划,展示了超越库匹配的泛化能力。
  • 在包括积木世界在内的三个规划领域中,其性能与传统计划识别方法相比具有竞争力或更优。
  • 通过跳字模型学习到的向量表示捕捉了动作序列中有意义的句法和语义模式,从而能够准确推断缺失动作。
  • 该方法显著降低了对完整领域模型的依赖,使其适用于现实世界中领域模型常不可用的人机协同规划场景。
  • 在大多数情况下,该方法能有效将正确下一步动作排在前m个推荐结果内,支持高效的人类决策。
  • 实证结果证实,学习到的动作向量编码了足够的结构信息,可支持稳健的计划识别与补全。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。