Skip to main content
QUICK REVIEW

[论文解读] Human-Agent Cooperation in Bridge Bidding

Edward Lockhart, Neil Burch|arXiv (Cornell University)|Nov 28, 2020
Reinforcement Learning in Robotics参考文献 15被引用 4
一句话总结

本文提出了一种强化学习方法,通过结合模仿学习、搜索算法与策略迭代,训练AI智能体在桥牌叫牌过程中与人类合作。该智能体在与人类专家搭档时,相较于表现强劲的手动编码机器人WBridge5,每副牌高出0.97 IMPs,同时完全兼容人类叫牌惯例。

ABSTRACT

We introduce a human-compatible reinforcement-learning approach to a cooperative game, making use of a third-party hand-coded human-compatible bot to generate initial training data and to perform initial evaluation. Our learning approach consists of imitation learning, search, and policy iteration. Our trained agents achieve a new state-of-the-art for bridge bidding in three settings: an agent playing in partnership with a copy of itself; an agent partnering a pre-existing bot; and an agent partnering a human player.

研究动机与目标

  • 开发一种AI智能体,使其能在桥牌叫牌这一复杂且高度依赖沟通的领域中与人类玩家有效协作。
  • 在提升性能的同时,保持与人类叫牌系统的兼容性,超越现有手动编码的机器人。
  • 使智能体能够通过模仿学习与迭代策略改进,学习并优化协作策略。
  • 不仅在与机器人对战中评估智能体表现,更在与人类专家直接搭档的对局中进行评估。
  • 通过采用保守的、软性策略更新,确保智能体的策略与人类惯例保持兼容。

提出的方法

  • 方法始于从人类兼容的WBridge5机器人所玩的手牌数据集中进行模仿学习,以初始化策略。
  • 使用搜索算法通过结合先验策略与模拟回溯结果来改进策略,模拟潜在的未来行动。
  • 在多个轮次(最多16轮)中应用策略迭代,每轮使用当前策略与搜索生成的新数据集,随后重新训练策略。
  • 训练期间,智能体使用WBridge5策略作为搭档,以确保兼容性;在测试时可选择性地应用更大规模的搜索以进一步提升性能。
  • 该方法假设搭档遵循初始策略,从而抑制不兼容策略创新,促进协调。
  • 最终智能体在“人在回路”设置下进行评估,即人类专家与智能体及一个机器人随机分配座位位置,在32副牌中进行搭档对局。

实验结果

研究问题

  • RQ1能否训练出一个AI智能体,在遵循标准人类叫牌系统的同时,与人类在桥牌叫牌中有效协作?
  • RQ2如何将模仿学习与策略迭代结合,以在不牺牲人类兼容性的情况下提升性能?
  • RQ3若一个智能体被训练为与强手写编码机器人协作,当其与人类专家搭档时,是否也优于该机器人?
  • RQ4该智能体性能的提升在多大程度上源于更优策略,而非双倍模拟棋盘假设或信息披露差异?
  • RQ5智能体是否能在保持与现有人类惯例兼容的同时,仍超越已确立的机器人对手?

主要发现

  • 当与人类专家搭档时,该智能体在每副牌中比WBridge5高出0.97 IMPs,平均值的标准误为0.76。
  • 人类专家观察到,该智能体遵循了标准美国黄卡体系,仅在判断上与WBridge5略有不同,未在体系或惯例上存在差异。
  • 该智能体在竞争性叫牌中略为激进,与现代人类专家实践一致。
  • 该智能体更偏好简单直接的叫牌流程,这种策略对解释差异更具鲁棒性。
  • 性能提升并非源于双倍模拟棋盘假设或叫牌过程中信息隐藏,表明其策略存在真正的改进。
  • 该智能体不仅与WBridge5保持兼容,且在与同一人类专家搭档时甚至超越了WBridge5,充分证明其具备强大的人类兼容性与协作能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。