Skip to main content
QUICK REVIEW

[论文解读] Improving Robot-Centric Learning from Demonstration via Personalized Embeddings

Mariah Schrum, Erin Hedlund|arXiv (Cornell University)|Oct 7, 2021
Robot Manipulation and Learning参考文献 20被引用 4
一句话总结

该论文提出 MIND MELD,一种元学习框架,通过利用变分推理学习人类演示者风格的个性化嵌入,以纠正次优反馈,从而提升以机器人为中心的模仿学习(LfD)性能。通过最大化校正标签与真实标签之间的互信息,MIND MELD 相较于原始人类反馈,将标签质量提升了 63%,从而在基于 DAgger 的训练中实现更优的策略学习。

ABSTRACT

Learning from demonstration (LfD) techniques seek to enable novice users to teach robots novel tasks in the real world. However, prior work has shown that robot-centric LfD approaches, such as Dataset Aggregation (DAgger), do not perform well with human teachers. DAgger requires a human demonstrator to provide corrective feedback to the learner either in real-time, which can result in degraded performance due to suboptimal human labels, or in a post hoc manner which is time intensive and often not feasible. To address this problem, we present Mutual Information-driven Meta-learning from Demonstration (MIND MELD), which meta-learns a mapping from poor quality human labels to predicted ground truth labels, thereby improving upon the performance of prior LfD approaches for DAgger-based training. The key to our approach for improving upon suboptimal feedback is mutual information maximization via variational inference. Our approach learns a meaningful, personalized embedding via variational inference which informs the mapping from human provided labels to predicted ground truth labels. We demonstrate our framework in a synthetic domain and in a human-subjects experiment, illustrating that our approach improves upon the corrective labels provided by a human demonstrator by 63%.

研究动机与目标

  • 解决在真实场景中,当使用次优人类提供的校正反馈进行训练时,DAgger 性能不佳的问题。
  • 建模人类反馈风格的个体差异,例如过度校正或不一致性,这些因素会降低以机器人为中心的模仿学习中的策略学习效果。
  • 开发一种元学习框架,从校正反馈序列中推断个性化嵌入,以将低质量标签映射到更准确的真实标签近似值。
  • 验证所学习的嵌入是否能捕捉人类演示者之间有意义的风格、人口统计学和人格相关差异。

提出的方法

  • MIND MELD 使用双向 LSTM 编码演示者随时间推移提供的校正反馈序列,以捕捉次优标签中的时间依赖性。
  • 采用变分推理,为每位演示者 $p$ 学习一个个性化嵌入向量 $\vec{w}^{(p)}$,以表示其个体反馈倾向和风格。
  • 通过对比损失函数,最大化所学习嵌入 $\vec{w}^{(p)}$、预测的校正差异 $d_{t'}^{(p)}$ 与编码表示 $\vec{z}$ 之间的互信息。
  • 一个神经网络头 $g_{\phi}$ 将嵌入和编码后的反馈映射到预测的校正动作,最小化与真实差异 $a_{t'}^{(p)} - o_{t'}$ 的均方误差(MSE)。
  • 模型在具有已知真实标签的校准任务上进行训练,使其能够学习从噪声较大的人类反馈到更优标签的映射。
  • 在推理阶段,新演示者使用训练集的平均嵌入进行初始化,其个性化嵌入通过自身反馈数据进行微调。

实验结果

研究问题

  • RQ1元学习框架能否提升以机器人为中心的模仿学习中次优人类提供的校正反馈质量?
  • RQ2通过变分推理学习到的个性化嵌入是否能捕捉人类演示者之间有意义的风格差异?
  • RQ3所学习的嵌入在多大程度上与演示者的人口统计学特征、人格特质和经验水平相关?
  • RQ4MIND MELD 能否缩小使用人类教师的 DAgger 与使用理想反馈(oracle)之间的性能差距?
  • RQ5该框架是否能通过使用先前参与者的平均嵌入初始化新演示者的嵌入,实现对新演示者的泛化?

主要发现

  • 与原始反馈相比,MIND MELD 将次优人类提供的校正标签质量提升了 63%。
  • 所学习的个性化嵌入与演示者风格倾向之间存在显著相关性,p 值小于 .001。
  • 嵌入与演示者性别显著相关(p = .0015),表明对人口统计差异具有敏感性。
  • 参与者在虚拟或实体汽车方面的经验以及神经质水平显示出接近显著的趋势(p 值分别为 .18、.15 和 .16),表明可能对行为特质具有敏感性。
  • 该框架成功捕捉了反馈风格的异质性,表明个体在纠正行为上的差异可以被有效建模与校正。
  • 结果表明,个性化嵌入可作为演示者行为的稳健表示,从而提升真实人机交互中模仿学习的性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。