[论文解读] K-level Reasoning for Zero-Shot Coordination in Hanabi
本文提出同步k级推理(SyKLR)及一种新型混合方法SyKLRBR,该方法并行训练k级推理的所有层级,并共同训练针对该层级结构的最优回应。该方法在《汉诺比》游戏中实现了最先进(SOTA)的零样本协作与即兴团队协作性能,显著提升了泛化能力与人机协作效果,且无需依赖握手协议或外部信息。
The standard problem setting in cooperative multi-agent settings is self-play (SP), where the goal is to train a team of agents that works well together. However, optimal SP policies commonly contain arbitrary conventions ("handshakes") and are not compatible with other, independently trained agents or humans. This latter desiderata was recently formalized by Hu et al. 2020 as the zero-shot coordination (ZSC) setting and partially addressed with their Other-Play (OP) algorithm, which showed improved ZSC and human-AI performance in the card game Hanabi. OP assumes access to the symmetries of the environment and prevents agents from breaking these in a mutually incompatible way during training. However, as the authors point out, discovering symmetries for a given environment is a computationally hard problem. Instead, we show that through a simple adaption of k-level reasoning (KLR) Costa Gomes et al. 2006, synchronously training all levels, we can obtain competitive ZSC and ad-hoc teamplay performance in Hanabi, including when paired with a human-like proxy bot. We also introduce a new method, synchronous-k-level reasoning with a best response (SyKLRBR), which further improves performance on our synchronous KLR by co-training a best response.
研究动机与目标
- 为解决合作多智能体环境中零样本协作的挑战,即独立训练的智能体或人类在无事先沟通的情况下实现协作。
- 克服自博弈训练的局限性,后者会产生脆弱且依赖约定的策略,与外部智能体不兼容。
- 将认知层级方法(如k级推理)适配至大规模、部分可观察的协作问题(如《汉诺比》)。
- 通过减少对任意通信约定的依赖,提升即兴团队协作与人机协作的鲁棒性。
- 探究同步训练层级推理是否能稳定学习过程,并相较于顺序训练提升性能。
提出的方法
- 并行同步训练所有k级推理智能体,而非顺序训练,以减少实际运行时间,并作为防止过拟合的正则化手段。
- 提出SyKLRBR这一混合方法,共同训练针对整个k级推理层级结构的最优回应,且对最高两级进行更高权重的训练。
- 采用分层训练架构,其中每个k级智能体将其他智能体建模为k-1级,但所有层级同时更新。
- 通过课程学习策略,先训练低层级,再逐步引入高层级,尽管所有层级均并行训练。
- 使用信念模型评估策略对任意约定的依赖程度,通过计算对游戏状态信念的交叉熵进行度量。
- 训练针对完整层级结构的最优回应,作为最终推理阶段的策略,实现在零样本场景下的实时适应。
实验结果
研究问题
- RQ1在复杂Dec-POMDP中,与顺序训练相比,k级推理智能体的同步训练是否能提升性能与稳定性?
- RQ2k级推理能否有效扩展至《汉诺比》这类大规模、部分可观察的协作问题?
- RQ3共同训练k级推理层级的最优回应是否能增强零样本协作与即兴团队协作性能?
- RQ4同步训练如何减少对低层级策略的过拟合,并提升泛化能力?
- RQ5与先前SOTA方法相比,该方法在与类人代理协作方面提升了多少?
主要发现
- SyKLRBR在自博弈评估中取得21.65±0.21的得分,优于《汉诺比》基准中先前的方法。
- 在交叉对弈评估中,SyKLRBR取得21.42±0.10的得分,展现出与独立训练智能体之间强大的零样本协作能力。
- 在与人类代理(克隆机器人)的对弈中,SyKLRBR取得14.59±0.25的得分,创下《汉诺比》游戏中人机协作的新SOTA纪录。
- 同步训练降低了对低层级策略的过拟合,表现为中间快照的信念模型交叉熵为1.70±0.01,而最终策略为1.58±0.01。
- 最优回应组件通过实现在推理阶段的实时适应,提升了即兴场景下的鲁棒性。
- 同步认知层级(CH)训练的表现劣于SyKLRBR,表明在本设置中,结合最优回应的k级推理比标准认知层级方法更有效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。