[论文解读] Competitive Multi-agent Inverse Reinforcement Learning with Sub-optimal Demonstrations
本文提出了一种新颖的竞争性多智能体逆强化学习框架,通过直接最小化专家策略与纳什均衡策略之间的性能差距,来处理次优专家演示。该方法采用深度神经网络进行对抗性训练,无需解耦智能体,联合学习奖励函数与纳什均衡策略,在大规模零和随机博弈(如10×10网格追逐游戏)中表现出优越性能。
This paper considers the problem of inverse reinforcement learning in zero-sum stochastic games when expert demonstrations are known to be not optimal. Compared to previous works that decouple agents in the game by assuming optimality in expert strategies, we introduce a new objective function that directly pits experts against Nash Equilibrium strategies, and we design an algorithm to solve for the reward function in the context of inverse reinforcement learning with deep neural networks as model approximations. In our setting the model and algorithm do not decouple by agent. In order to find Nash Equilibrium in large-scale games, we also propose an adversarial training algorithm for zero-sum stochastic games, and show the theoretical appeal of non-existence of local optima in its objective function. In our numerical experiments, we demonstrate that our Nash Equilibrium and inverse reinforcement learning algorithms address games that are not amenable to previous approaches using tabular representations. Moreover, with sub-optimal expert demonstrations our algorithms recover both reward functions and strategies with good quality.
研究动机与目标
- 解决现有多智能体IRL方法假设专家演示为最优的局限性,该假设在复杂游戏中往往不现实。
- 开发一种统一框架,避免解耦智能体,实现奖励函数与纳什均衡策略的联合学习。
- 在零和随机博弈中,最小化专家演示与最优(纳什均衡)策略之间的性能差距。
- 设计一种对抗性训练算法,用于纳什均衡计算,并提供全局收敛性的理论保证。
- 在表格方法失效的大规模博弈中,验证该方法的有效性。
提出的方法
- 该算法在策略步骤与奖励步骤之间交替进行:策略步骤通过对抗性训练计算纳什均衡;奖励步骤则更新奖励函数,以减小专家策略与纳什策略之间的性能差距。
- 对抗性训练使智能体与其最优对手对战,采用近端策略优化(PPO)进行策略改进,并使用深度神经网络建模策略与价值函数。
- 奖励函数建模为深度神经网络,通过随机梯度下降进行训练,以最小化专家动作与当前纳什策略所产生最优动作之间的性能差距。
- 为防止次优动作被允许,引入带有固定拉格朗日乘子λ的惩罚项,λ通过网格搜索调优(最优值λ=10)。
- 通过在联合优化循环中同时优化策略与奖励,避免智能体解耦,从而保持博弈论意义上的相互依赖性。
- 理论分析表明,对抗性训练目标无局部最优解,支持向全局最优解的收敛。
实验结果
研究问题
- RQ1当专家演示为次优时,我们能否有效恢复奖励函数与纳什均衡策略?
- RQ2如何设计一种不解耦智能体的联合学习框架,以在多智能体IRL中保持战略相互依赖性?
- RQ3显式最小化专家与纳什均衡策略之间性能差距,对学习质量有何影响?
- RQ4结合深度强化学习的对抗性训练能否在零和随机博弈中实现全局收敛?
- RQ5该方法在表格方法无法处理的大规模博弈中,扩展性能如何?
主要发现
- 在10×10网格追逐游戏中,与采用解耦优化的基准算法相比,所提算法使捕食者策略性能提升了48.6%。
- 对于猎物,在10×10网格中,所提方法相比基准算法实现了5.9%的性能提升。
- 在5×5网格中,所提算法生成了更优的捕食者策略(-44.7 vs. -87.4),并实现了与基准算法相当的猎物性能。
- 该算法成功恢复了过大而无法使用表格IRL方法的游戏的奖励函数与策略,展示了良好的可扩展性。
- 性能差距最小化目标即使在次优专家演示下,也带来了更高质量的策略恢复。
- 对抗性训练目标被证明无局部最优解,支持稳定且全局收敛的学习。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。