Skip to main content
QUICK REVIEW

[论文解读] Interactive Robot Training for Non-Markov Tasks

Ankit Shah, Wadhwania, Samir|arXiv (Cornell University)|Mar 4, 2020
Machine Learning and Algorithms参考文献 30被引用 5
一句话总结

本文提出了一种贝叶斯交互式机器人训练框架,通过结合人类示范和机器人行为的实时评估,学习非马尔可夫任务规范。通过使用主动学习查询最不确定的任务执行,该方法在模拟和真实世界用户研究中均实现了比仅依赖示范或随机查询基线更高的真实LTL规范相似度,成功教会机器人摆放餐桌,平均相似度达到86%。

ABSTRACT

Defining sound and complete specifications for robots using formal languages is challenging, while learning formal specifications directly from demonstrations can lead to over-constrained task policies. In this paper, we propose a Bayesian interactive robot training framework that allows the robot to learn from both demonstrations provided by a teacher, and that teacher's assessments of the robot's task executions. We also present an active learning approach -- inspired by uncertainty sampling -- to identify the task execution with the most uncertain degree of acceptability. Through a simulated experiment, we demonstrate that our active learning approach identifies a teacher's intended task specification with an equivalent or greater similarity when compared to an approach that learns purely from demonstrations. Finally, we demonstrate the efficacy of our approach in a real-world setting through a user-study based on teaching a robot to set a dinner table.

研究动机与目标

  • 为解决使用LTL等形式语言直接指定复杂、时序结构化的机器人任务的挑战,这些语言对非专家而言难以直接编写。
  • 通过在机器人行为上引入人类反馈,减少仅从示范中学习所导致的过度约束策略。
  • 开发一种主动学习策略,识别并查询机器人最不确定的任务执行,以高效地细化对LTL规范的信念。
  • 在模拟和真实世界用户研究中验证该框架,涉及教会机器人摆放餐桌。

提出的方法

  • 该框架将任务规范建模为线性时序逻辑(LTL)公式的信念分布,以表示教师意图规范的不确定性。
  • 统一了两种教学模式:教师的示范和对机器人执行任务序列的评估。
  • 基于不确定性采样的主动学习策略,选择可接受性熵最高的机器人执行进行人类评估。
  • 每次人类评估后,使用贝叶斯推断更新信念分布,从而减少规范的不确定性。
  • 使用最大后验概率(MAP)估计从后验分布中识别最可能的LTL公式。
  • 该方法在模拟和真实世界用户研究中进行了评估,涉及具身机器人部署。

实验结果

研究问题

  • RQ1结合示范和人类对机器人行为评估的交互式学习框架,能否提升非马尔可夫任务的规范学习效果?
  • RQ2与仅被动学习示范相比,主动查询最不确定的机器人执行是否能实现更快、更准确地收敛到真实任务规范?
  • RQ3该主动学习方法在真实世界人机交互中,对教学复杂、时序结构化任务的有效性如何?
  • RQ4在真实世界设置中,机器人最终的信念分布与真实LTL规范的对齐程度如何?

主要发现

  • 在真实世界用户研究中,机器人最终信念与真实任务规范之间的平均相似度为0.86(95%置信区间[0.82, 0.92])。
  • 对于任务1,最终信念与真实规范的中位数相似度为0.87(95%置信区间[0.73, 0.94]),21名参与者中有14名成功恢复了真实公式作为最可能的LTL规范。
  • 对于任务2,中位数相似度为0.78(95%置信区间[0.59, 0.99]),6名参与者中有2名将真实公式识别为最可能的规范。
  • 在任务1的四次案例中,后验信念与真实规范仅相差一个合取子句;在任务2的两次案例中亦如此,表明规范恢复具有高精度。
  • 所有参与者在测试执行中均未出现错误,成功教会机器人完成指定任务,证明了方法的鲁棒性和实际可行性。
  • 在模拟中,主动学习方法优于批量学习(仅示范)和随机查询基线,在多种任务规范下均实现了更高的真实规范相似度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。