[论文解读] Inferring Robot Task Plans from Human Team Meetings: A Generative Modeling Approach with Logic-Based Prior
本文提出一种混合生成建模方法,通过基于逻辑的计划验证生成结构化先验,从结构化对话转录本中推断人类团队任务计划,在输入嘈杂且稀疏的情况下,平均准确率达到83%,显著提升了时间关键型人机协作场景中计划的准确性和鲁棒性。该方法结合概率推理与基于PDDL的逻辑约束,实现更优的性能表现。
We aim to reduce the burden of programming and deploying autonomous systems to work in concert with people in time-critical domains, such as military field operations and disaster response. Deployment plans for these operations are frequently negotiated on-the-fly by teams of human planners. A human operator then translates the agreed upon plan into machine instructions for the robots. We present an algorithm that reduces this translation burden by inferring the final plan from a processed form of the human team's planning conversation. Our approach combines probabilistic generative modeling with logical plan validation used to compute a highly structured prior over possible plans. This hybrid approach enables us to overcome the challenge of performing inference over the large solution space with only a small amount of noisy data from the team planning session. We validate the algorithm through human subject experimentation and show we are able to infer a human team's final plan with 83% accuracy on average. We also describe a robot demonstration in which two people plan and execute a first-response collaborative task with a PR2 robot. To the best of our knowledge, this is the first work that integrates a logical planning technique within a generative model to perform plan inference.
研究动机与目标
- 减少在灾难响应和军事行动等时间关键型领域中,将人类团队规划对话转换为可执行机器人计划的人工负担。
- 解决在高压团队规划会话中,从少量、嘈杂的对话数据中推断准确任务计划的挑战。
- 将逻辑计划验证整合到概率生成模型中,构建结构化先验,以提升在大规模解空间中的推理性能。
- 通过真人受试实验和使用PR2机器人的实际演示验证该方法的有效性。
- 证明无需完美输入或预先存在的PDDL规范,即可自动从人类团队对话中推断可执行机器人计划的可行性。
提出的方法
- 该方法采用基于Gibbs采样和Metropolis-Hastings MCMC的生成模型,从结构化对话转录本中推断计划。
- 通过PDDL 2.1计划验证生成基于逻辑的先验,编码动作序列、资源限制和先决条件等约束(例如,机器人检查后人类方可进入)。
- 模型通过结合对话数据的似然权重与逻辑约束的有效性,对候选计划进行加权,从而在可能的计划空间中执行推理。
- 输入为经处理的、结构化的对话形式,保留对话中的噪声与简洁性,避免原始NLP处理的复杂性。
- 算法采用加权先验(w_p = 0.8)及超参数α=10, β=5,以在采样过程中平衡数据似然与逻辑有效性。
- 通过三项指标评估计划准确率:% Inferred(正确谓词比例)、% Noise Rej(被正确排除的冗余谓词比例)和% Seq(有效谓词的正确相对顺序比例)。
实验结果
研究问题
- RQ1概率生成模型能否在高压规划场景中,有效从少量、嘈杂的对话转录本中推断人类团队任务计划?
- RQ2与非结构化先验相比,通过PDDL验证生成的逻辑先验在多大程度上提升了计划推理的准确性?
- RQ3该推理方法在PDDL规范不完整或退化时,其鲁棒性如何?
- RQ4系统在多大程度上能准确排除团队会话中讨论但未包含在最终计划中的冗余或错误谓词?
- RQ5所推断的计划能否在真实世界协作任务场景中被机器人成功执行?
主要发现
- 该算法在所有评估条件下平均计划准确率达到83.0%,其中92.2%的推断谓词与最终团队计划一致。
- 系统展现出强大的噪声排斥能力,成功排除了71.0%的未被包含在最终计划中的冗余谓词。
- 即使在PDDL输入退化的情况下(如缺少目标或约束),该方法仍保持高准确率,PDDL-1和PDDL-2条件下平均准确率达81.1%。
- 当无PDDL信息可用(即无信息先验)时,准确率下降至76.8%,证实了逻辑约束在引导推理过程中的关键价值。
- 该方法成功使PR2机器人基于人类团队协作会话中推断出的计划,自主完成导航与房间检查任务。
- 该方法对不完整或噪声输入具有强鲁棒性,在PDDL规范中缺少关键计划元素(如目标或先决条件)时仍能保持高性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。