[论文解读] Trust-Aware Decision Making for Human-Robot Collaboration: Model Learning and Planning
本文提出了一种信任感知的POMDP模型,使机器人能够通过从交互数据中学习,推断并影响人类的信任。通过战略性地操控信任——例如在低风险任务上故意失败——机器人提升了长期团队表现,在模拟和现实世界中的桌面清理任务中,优于短视策略和最大化信任的策略。
Trust in autonomy is essential for effective human-robot collaboration and user adoption of autonomous systems such as robot assistants. This paper introduces a computational model which integrates trust into robot decision-making. Specifically, we learn from data a partially observable Markov decision process (POMDP) with human trust as a latent variable. The trust-POMDP model provides a principled approach for the robot to (i) infer the trust of a human teammate through interaction, (ii) reason about the effect of its own actions on human trust, and (iii) choose actions that maximize team performance over the long term. We validated the model through human subject experiments on a table-clearing task in simulation (201 participants) and with a real robot (20 participants). In our studies, the robot builds human trust by manipulating low-risk objects first. Interestingly, the robot sometimes fails intentionally in order to modulate human trust and achieve the best team performance. These results show that the trust-POMDP calibrates trust to improve human-robot team performance over the long term. Further, they highlight that maximizing trust alone does not always lead to the best performance.
研究动机与目标
- 为解决自主系统中人类信任错位的问题,该问题可能阻碍有效的人机协作。
- 通过在POMDP框架中将信任作为隐变量整合,实现信任建模与机器人决策之间的闭环。
- 使机器人能够通过交互推断人类信任水平,并调整行为以使信任与机器人的实际能力相匹配。
- 通过在信任校准与任务效率之间取得平衡,尤其在机器人发生故障的情况下,提升长期团队表现。
- 证明最大化信任并不总是最优策略,战略性地调节信任可带来更优的整体表现。
提出的方法
- 信任-POMDP模型将信任表示为部分可观察马尔可夫决策过程中的隐变量,使机器人能够推理未被直接观测到的人类信任水平。
- 该模型从人类交互数据中学习信任动态组件,捕捉信任如何随机器人行为而演变。
- 学习人类决策模型,将信任水平与人类干预行为(如阻止机器人执行高风险动作)关联起来。
- 机器人使用POMDP策略选择能最大化长期团队表现的动作,平衡信任建立与任务进展。
- 在高故障概率的情境下,机器人在低价值物体(如瓶子)上故意失败,以降低过度自信,防止在高价值物体(如玻璃杯)上发生后续故障。
- 该模型通过201名参与者在模拟环境中的数据以及20名参与者与真实机器人在桌面清理任务中的数据进行训练和验证。
实验结果
研究问题
- RQ1当信任无法被直接观测时,机器人如何系统性地推断人机协作过程中的信任水平?
- RQ2机器人行为对人类信任演变的影响是什么?如何在计算上建模这种影响?
- RQ3机器人能否通过战略性地调节人类信任来提升长期团队表现,即使这意味着有意失败?
- RQ4在机器人故障可能发生的情况下,最大化人类信任是否始终对任务表现最优?
- RQ5信任感知策略的表现与忽略信任的短视策略相比如何?
主要发现
- 与短视策略相比,信任-POMDP策略显著降低了人类干预率,表明协作与表现得到改善。
- 机器人通过先处理低风险物品(如塑料瓶)成功建立了信任,从而在高风险操作期间减少了人类干预。
- 在对葡萄酒杯故障概率较高的场景中,信任-POMDP策略在瓶子上故意失败,以降低过度自信,避免了在高价值物品上的后续失败。
- 表现最大化策略在10,000次运行中的平均累积奖励为-1.36,显著优于信任最大化策略的-1.65(p < 0.001)。
- 在机器人故障可能发生的情况下,最大化信任并非最优策略,因为故障发生时会导致信任急剧下降,从而降低长期表现。
- 该模型表明,信任校准——既不过度也不低估信任——对于实现最优人机团队表现至关重要。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。