Skip to main content
QUICK REVIEW

[论文解读] Limiting dynamics for Q-learning with memory one in symmetric two-player, two-action games

Janusz M Meylahn, Janssen, Lars|arXiv (Cornell University)|Jul 29, 2021
Receptor Mechanisms and Signaling被引用 7
一句话总结

本文提出一种计算方法,利用具有单期记忆的Q-learning,在两人两行动重复博弈中识别吸收态和互为最优响应动态。通过构建迭代互为最优响应网络(IBRNs),作者证明在无限批量大小极限下,样本批量Q-learning收敛于这些动态,揭示了重复囚徒困境、狩猎游戏和鹰鸽博弈中的吸收态与极限环。

ABSTRACT

We develop a method based on computer algebra systems to represent the mutual pure strategy best-response dynamics of symmetric two-player, two-action repeated games played by players with a one-period memory. We apply this method to the iterated prisoner's dilemma, stag hunt and hawk-dove games and identify all possible equilibrium strategy pairs and the conditions for their existence. The only equilibrium strategy pair that is possible in all three games is the win-stay, lose-shift strategy. Lastly, we show that the mutual best-response dynamics are realized by a sample batch Q-learning algorithm in the infinite batch size limit.

研究动机与目标

  • 建立一个计算框架,用于识别使用单期记忆的Q-learners在两人两行动重复博弈中所有纯策略均衡点。
  • 建模并分析在无限批量大小极限下样本批量Q-learning的极限动态。
  • 刻画关键博弈论模型中吸收态与极限环的存在性与结构:重复囚徒困境、狩猎游戏与鹰鸽博弈。
  • 提供一种图形化表示——迭代互为最优响应网络(IBRNs),以捕捉在最优响应更新下的确定性策略动态。
  • 将Q-learning的理论收敛性与互为最优响应动态相联系,从而实现对参数空间中合作可能性的分析。

提出的方法

  • 通过评估在单期记忆下哪些策略对彼此互为最优响应,构建纯策略互为最优响应图。
  • 将样本批量Q-learning的无限批量大小极限定义为一个确定性动力系统,其中Q值收敛于贝尔曼方程的解。
  • 利用贝尔曼方程基于对手策略计算每个玩家的期望Q值,从而识别互为最优响应。
  • 生成迭代互为最优响应网络(IBRNs),以表示在同时最优响应更新下的策略转移。
  • 将该方法应用于三个典型博弈:重复囚徒困境(PD)、狩猎游戏(SH)和鹰鸽博弈(HD),分析在不同贴现因子下的相图。
  • 结合数值与理论分析,根据吸收态与极限环的存在性对参数空间区域进行分类。

实验结果

研究问题

  • RQ1在使用单期记忆的Q-learners的两人两行动重复博弈中,所有可能的纯策略均衡对是什么?
  • RQ2在无限批量大小下,样本批量Q-learning的极限动态如何对应于互为最优响应动态?
  • RQ3博弈参数(尤其是贴现因子)在何种条件下会导致重复囚徒困境、狩猎游戏与鹰鸽博弈中特定吸收态的存在?
  • RQ4极限环是否可能在互为最优响应动态中出现,它们对Q-learning收敛性意味着什么?
  • RQ5吸收态的吸引盆在不同博弈与参数区域中如何变化?

主要发现

  • 在重复囚徒困境中,三种对称解——全背叛(All-D)、冷酷触发(GT)和赢留输换(WSLS)——是唯一可能存在的纯策略均衡对。
  • 该方法成功识别了狩猎游戏与鹰鸽博弈中所有吸收态及其存在条件。
  • 由于同时最优响应更新,极限环可能出现在IBRN图中,但它们是确定性批量更新机制的产物,在学习率降低时不会持续存在。
  • IBRN表示准确捕捉了样本批量Q-learning的极限动态,证实IBRN中的吸收态对应于任何收敛至纯策略的Q-learning算法的吸收态。
  • 随着贴现因子δ增大,重复囚徒困境中三种均衡共存的参数空间区域扩大,而在狩猎游戏与鹰鸽博弈中,特定均衡组合存在的区域缩小。
  • IBRN可视化显示,在狩猎游戏与鹰鸽博弈中,吸收态的吸引盆分布比重复囚徒困境更均衡。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。