[论文解读] On the Utility of Model Learning in HRI
本文通过在自动驾驶模拟中对比无模型、黑箱模型化和基于心智理论(ToM)的学习方法,研究了心智理论(ToM)在人机交互(HRI)中的效用。结果表明,当假设正确时,ToM显著降低了样本复杂度,在分布偏移下优于黑箱方法,并且在人类行为变化下泛化能力更强,尽管在假设错误时性能会下降。
Fundamental to robotics is the debate between model-based and model-free learning: should the robot build an explicit model of the world, or learn a policy directly? In the context of HRI, part of the world to be modeled is the human. One option is for the robot to treat the human as a black box and learn a policy for how they act directly. But it can also model the human as an agent, and rely on a "theory of mind" to guide or bias the learning (grey box). We contribute a characterization of the performance of these methods for an autonomous driving task under the optimistic case of having an ideal theory of mind, as well as under different scenarios in which the assumptions behind the robot's theory of mind for the human are wrong, as they inevitably will be in practice.
研究动机与目标
- 评估在理想和不完美假设下,心智理论(ToM)在人机交互(HRI)中是否具有性能优势。
- 从样本复杂度和数据效率的角度,比较无模型、黑箱模型化和基于ToM的学习方法。
- 分析当ToM假设与人类行为不一致时,模型性能如何退化。
- 评估在人类行为分布发生偏移时,基于ToM和黑箱模型的可迁移性。
- 理解预测准确性、规划次优性与HRI中数据收集之间的权衡。
提出的方法
- 作者设计了一个简化的自动驾驶任务,其中机器人需在人类驾驶员存在的情况下安全完成变道操作。
- 他们实现了三种范式:无模型(直接策略学习)、黑箱模型化(从数据中学习人类策略)和基于ToM的(将人类建模为具有未知参数的奖励优化代理)。
- 基于ToM的方法使用逆强化学习,从观察到的行为中推断人类奖励函数。
- 机器人利用推断出的人类模型来规划能够预判人类反应的动作。
- 在不同的人类行为模型下评估性能,包括驾驶风格、反应时间及可见性的变化。
- 实验使用了在线策略和离线策略数据,并通过消融实验研究了数据分布偏移和模型迁移能力。
实验结果
研究问题
- RQ1与黑箱和无模型方法相比,使用完美心智理论(ToM)模型在HRI中能带来多大的性能提升?
- RQ2在HRI中,无模型、黑箱模型化和基于ToM的学习在样本复杂度上如何不同?
- RQ3当对人类行为的ToM假设不正确时,性能会如何退化?
- RQ4在人类行为分布发生偏移时,基于ToM的方法是否比黑箱模型具有更好的泛化能力?
- RQ5在数据充足的情况下,黑箱模型化学习在何种条件下仍会失败?
主要发现
- 在理想ToM假设下,该方法相比黑箱模型化学习显著降低了样本复杂度,并且仅需极少的在线策略数据即可实现高性能。
- 黑箱模型化学习所需数据量比ToM高出一个数量级,并且在数据分布发生偏移时无法实现泛化。
- 无模型学习所需数据量高出几个数量级,且未能达到有竞争力的性能。
- 在分布偏移下,如人类速度、攻击性或可见性发生变化时,基于ToM的方法比黑箱模型泛化能力更强。
- 即使假设错误,由于其结构归纳偏置,ToM在某些情况下仍优于黑箱方法,尽管随着模型误差增加,性能会下降。
- 本研究揭示,ToM的优势不仅体现在数据效率上,还体现在对分布偏移的鲁棒性上,尤其当结合人类-人类数据预训练时更为显著。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。