[论文解读] Modelling Bounded Rationality in Multi-Agent Interactions by Generalized Recursive Reasoning
本文提出了广义递归推理(GR2),一种新颖的多智能体强化学习框架,通过使智能体能够以分层的复杂度水平进行推理,来建模有限理性。GR2利用概率图模型与软演员-critic算法,实现收敛至不动点,并在非合作型博弈、合作导航以及凯恩斯选美竞赛中,有效应对多种对手类型,优于当前最先进基线模型。
Though limited in real-world decision making, most multi-agent reinforcement learning (MARL) models assume perfectly rational agents -- a property hardly met due to individual's cognitive limitation and/or the tractability of the decision problem. In this paper, we introduce generalized recursive reasoning (GR2) as a novel framework to model agents with different \emph{hierarchical} levels of rationality; our framework enables agents to exhibit varying levels of "thinking" ability thereby allowing higher-level agents to best respond to various less sophisticated learners. We contribute both theoretically and empirically. On the theory side, we devise the hierarchical framework of GR2 through probabilistic graphical models and prove the existence of a perfect Bayesian equilibrium. Within the GR2, we propose a practical actor-critic solver, and demonstrate its convergent property to a stationary point in two-player games through Lyapunov analysis. On the empirical side, we validate our findings on a variety of MARL benchmarks. Precisely, we first illustrate the hierarchical thinking process on the Keynes Beauty Contest, and then demonstrate significant improvements compared to state-of-the-art opponent modeling baselines on the normal-form games and the cooperative navigation benchmark.
研究动机与目标
- 为解决现有MARL模型假设完全理性的局限性,该假设在现实世界中因认知与计算约束而极少成立。
- 受行为博弈论中的认知层级理论与有限理性启发,建模具有不同理性水平的智能体。
- 开发一个理论基础坚实的框架,支持多智能体系统中完美贝叶斯均衡的存在性与收敛的学习动态。
- 设计一种实用的演员-critic算法,使智能体能够最佳响应不同推理水平的对手。
- 在包括非合作型博弈与合作导航任务在内的多样化MARL基准上,对框架进行实证验证。
提出的方法
- GR2构建了一个分层推理结构,其中智能体被赋予从L0到Lk的层级,L0为非策略性,更高层级则递归地建模低层级对手。
- 该框架使用概率图模型表示对对手类型与推理层级的信念分布。
- 在GR2中推导出一种软演员-critic算法,引入辅助损失以增强策略表达能力,并引导联合Q函数的学习。
- 理论分析证明,在GR2下完美贝叶斯均衡存在,并通过李雅普诺夫分析建立策略梯度方法在两人非合作型博弈中收敛至不动点的性质。
- 通过建模不同推理层级下对手心智状态的信念,该方法支持嵌套推理(例如:'我认为你认为我认为...')。
- 该框架在自对弈与零样本评估中应用于多种基线模型,包括DDPG-ToM、PR2与独立学习者。
实验结果
研究问题
- RQ1与假设完全理性相比,分层推理框架是否能更有效地建模多智能体系统中的有限理性?
- RQ2GR2框架是否支持在具有多样化推理层级的多智能体交互中存在完美贝叶斯均衡?
- RQ3在李雅普诺夫稳定性分析下,GR2演员-critic算法是否能在两人非合作型博弈中收敛至不动点?
- RQ4在具有多个均衡与协调挑战的博弈中,GR2相较于最先进对手建模基线模型表现如何?
- RQ5在复杂高维环境(如合作导航)中,GR2智能体能否泛化至未见过的、具有不同理性水平的对手?
主要发现
- 在非合作型博弈的循环赛评估中,GR2-M智能体优于所有基线模型,成功识别并收敛至正确均衡,展现出对多种对手类型的鲁棒性。
- 在凯恩斯选美竞赛中,GR2智能体展现出与人类有限理性一致的分层思维过程,高层级智能体收敛至接近实验平均值(13–25)的数值,而非纳什均衡的0。
- 在旋转博弈(RG)中,L0策略陷入非收敛的循环动态,而GR2-L策略收敛至唯一均衡点(0.5, 0.5),且高层级策略收敛速度更快。
- 在猎鹿博弈(SH)中,GR2模型与PR2、DDPG-ToM成功达到帕累托最优均衡(S,S),获得最大奖励4;而其他模型无法摆脱低效均衡(P,P)。
- 在合作导航任务中,GR2智能体在自对弈与零样本评估中均表现更优,通过适应对手的不同目标(如瞄准不同地标)更有效地避免碰撞。
- 消融实验表明,GR2目标函数中的辅助损失可提升策略表达能力,并引导联合Q函数向更优策略优化方向发展,尤其在使用确定性轨迹时效果显著。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。