Skip to main content
QUICK REVIEW

[论文解读] Evaluation of Human-AI Teams for Learned and Rule-Based Agents in Hanabi

Ho Chit Siu, Jaime Peña|arXiv (Cornell University)|Jul 15, 2021
Ethics and Social Impacts of AI参考文献 42被引用 16
一句话总结

本研究通过基于规则的(SmartBot)和基于深度强化学习的(Other-Play)智能体,评估了汉诺伊游戏中人类与AI的协作。尽管客观游戏得分无显著差异,人类在信任、可解释性和感知协作方面始终更偏好基于规则的智能体,揭示了协作式AI系统中客观表现与人类偏好之间存在关键脱节。

ABSTRACT

Deep reinforcement learning has generated superhuman AI in competitive games such as Go and StarCraft. Can similar learning techniques create a superior AI teammate for human-machine collaborative games? Will humans prefer AI teammates that improve objective team performance or those that improve subjective metrics of trust? In this study, we perform a single-blind evaluation of teams of humans and AI agents in the cooperative card game Hanabi, with both rule-based and learning-based agents. In addition to the game score, used as an objective metric of the human-AI team performance, we also quantify subjective measures of the human's perceived performance, teamwork, interpretability, trust, and overall preference of AI teammate. We find that humans have a clear preference toward a rule-based AI teammate (SmartBot) over a state-of-the-art learning-based AI teammate (Other-Play) across nearly all subjective metrics, and generally view the learning-based agent negatively, despite no statistical difference in the game score. This result has implications for future AI design and reinforcement learning benchmarking, highlighting the need to incorporate subjective metrics of human-AI teaming rather than a singular focus on objective task performance.

研究动机与目标

  • 探究深度强化学习是否能在合作性、不完全信息游戏中产生人类更偏好的AI队友。
  • 比较人类与AI在汉诺伊游戏中基于规则与学习型AI智能体的团队表现及主观感知。
  • 评估团队得分的客观表现优越性是否能转化为更高的信任度、可解释性及偏好度。
  • 识别客观AI表现与主观人类-AI协作体验之间的差距。
  • 通过强调可解释性与以人为中心的度量标准,而非纯粹的任务表现,为未来AI设计提供建议。

提出的方法

  • 开展了一项单盲人类-AI协作实验,26名参与者与SmartBot(基于规则)或Other-Play(深度强化学习)智能体配对在汉诺伊游戏中进行游戏。
  • 收集了包括最终游戏得分和使用提示数在内的客观指标,以及通过游戏后调查问卷获取的信任度、可解释性、感知表现和队友偏好等主观指标。
  • 采用被试内设计,每位参与者以随机顺序与每种智能体类型各进行两场比赛,以控制学习效应。
  • 应用统计分析比较两种AI智能体在游戏得分和主观评分上的差异。
  • 分析定性反馈,识别在策略感知、可预测性及协作感方面的模式。
  • 基于跨对战表现和对汉诺伊规则的遵守情况(包括出牌、弃牌和提示行为)评估智能体。

实验结果

研究问题

  • RQ1基于深度强化学习的AI队友在汉诺伊游戏中是否比基于规则的队友更受人类欢迎?
  • RQ2客观团队表现(游戏得分)与主观人类感知的信任度、可解释性及协作感之间是否存在相关性?
  • RQ3当表现相当的情况下,人类是否认为基于规则的智能体比学习型智能体更具可预测性和可解释性?
  • RQ4即使学习型智能体专为与未知伙伴跨对战而优化,是否仍可能被人类队友负面评价?
  • RQ5人类玩家在多大程度上会根据其AI队友的感知一致性和清晰度调整自身策略?

主要发现

  • 使用基于规则的智能体(SmartBot)与学习型智能体(Other-Play)的团队之间,游戏得分无统计学显著差异,两者平均得分相近。
  • 人类在所有主观指标上均表现出对基于规则智能体的强烈且一致的偏好,包括感知协作、信任度、可解释性及整体偏好。
  • 参与者报告称,基于规则智能体的弃牌和提示策略更具可预测性,且更符合人类预期,即使在理论上并非最优。
  • 学习型智能体常被认为不可预测且不可靠,玩家表示难以理解其决策过程,不得不对其行为进行补偿。
  • 尽管该学习型智能体专门针对与未知伙伴的跨对战进行训练,但其协作性与直观性仍低于基于规则的智能体。
  • 定性反馈表明,参与者感觉与基于规则的智能体更契合,形容其更具“人性化友好”特征,且随时间推移更易于协调。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。