[论文解读] Neural Recursive Belief States in Multi-Agent Reinforcement Learning
本文提出神经递归信念状态(NRBS),一种可扩展的深度生成模型,使多智能体强化学习智能体能够使用递归神经信念网络对高阶信念(如对他人信念的信念)进行推理。在复杂的部分可观察马尔可夫博弈(如剪刀石头布)中,该方法显著优于无模型基线方法,使用高阶信念模型的智能体表现优于低阶或无信念建模的智能体。
In multi-agent reinforcement learning, the problem of learning to act is particularly difficult because the policies of co-players may be heavily conditioned on information only observed by them. On the other hand, humans readily form beliefs about the knowledge possessed by their peers and leverage beliefs to inform decision-making. Such abilities underlie individual success in a wide range of Markov games, from bluffing in Poker to conditional cooperation in the Prisoner's Dilemma, to convention-building in Bridge. Classical methods are usually not applicable to complex domains due to the intractable nature of hierarchical beliefs (i.e. beliefs of other agents' beliefs). We propose a scalable method to approximate these belief structures using recursive deep generative models, and to use the belief models to obtain representations useful to acting in complex tasks. Our agents trained with belief models outperform model-free baselines with equivalent representational capacity using common training paradigms. We also show that higher-order belief models outperform agents with lower-order models.
研究动机与目标
- 解决多智能体部分可观察性问题,即智能体必须对未观测到的信息和合作方策略进行推理。
- 利用深度学习克服复杂环境中分层信念结构(如对他人信念的信念)的不可行性。
- 使智能体能够形成并利用递归信念状态,以改善竞争性和合作性多智能体环境中的决策。
- 证明高阶信念建模相较于低阶或无模型基线方法可带来性能提升。
- 在保持深度强化学习的可扩展性和领域无关性的同时,整合结构化、可解释的信念表示。
提出的方法
- 使用递归深度生成模型近似分层信念状态,不仅建模世界状态,还建模对他人信念的信念(B1、B2等)。
- 通过处理观察历史的RNN生成的神经编码表示信念状态,模拟贝叶斯滤波动力学。
- 通过无监督学习端到端训练信念模型,无需真实状态监督,以保持可扩展性。
- 将策略学习条件化于神经信念表示,使智能体能够基于对他人私有信息和策略的推断进行行动。
- 采用嵌套采样并引入因子K以近似高阶信念分布,其中K控制信念估计中使用的样本数量。
- 保持标准策略梯度更新,不修改学习规则,确保与现有深度强化学习框架的兼容性。
实验结果
研究问题
- RQ1递归信念模型是否能提升在存在隐藏信息的部分可观察马尔可夫博弈中的多智能体决策能力?
- RQ2高阶信念建模(如B1、B2)是否相较于低阶或无模型基线带来可测量的性能增益?
- RQ3在信念近似中使用的样本数量(K)如何影响递归信念学习的稳定性和性能?
- RQ4神经信念模型是否能在复杂环境中高效且可扩展地训练,而无需显式状态监督?
- RQ5在多大程度上,利用递归信念的智能体优于仅依赖原始观察历史或无模型策略的智能体?
主要发现
- 在剪刀石头布环境中,使用10个样本的NRBS智能体在性能上优于无模型基线和使用1个样本的智能体。
- 在老虎游戏中,使用10个样本的智能体成功学习到正确的高阶信念分布,而使用1个样本的智能体则完全失败。
- B1智能体(建模他人信念)的平均回报高于B0智能体(无信念建模),但前提是使用足够采样量(K=10);当K=1时,B1智能体表现更差且方差更高。
- 当K=10时,B1与B0智能体之间的性能差距显著,表明更丰富的信念表示可实现更好的战略推理。
- 高阶信念模型(B2及以上)在实践中有效,暗示其在汉诺伊等复杂游戏中具备实现更深层次心智理论推理的潜力。
- 该方法保持了可扩展性和领域无关性,因其未修改策略更新规则,可无缝集成至标准深度强化学习训练范式中。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。