Skip to main content
QUICK REVIEW

[论文解读] Learning to Collaborate in Markov Decision Processes

Goran Radanović, Rati Devidze|arXiv (Cornell University)|Jan 23, 2019
Advanced Bandit Algorithms Research参考文献 36被引用 14
一句话总结

该论文提出了一种新型在线学习算法,用于合作性两智能体马尔可夫决策过程(MDP),其中一个智能体(A₁)能够在另一个智能体(A₂)随时间动态调整其策略的情况下,依然实现有效的协作。在假设A₂的策略变化速率受𝒪(T⁻ᵅ)限制(α > 0)的前提下,该方法实现了𝒪(T^{max{1−(3/7)α, 1/4}})的次线性遗憾,并证明该速率在计算上是必要的。该方法结合了近期性偏差与专家学习技术,以应对非平稳的转移和奖励,确保在平稳博弈MDP中实现接近最优的联合回报。

ABSTRACT

We consider a two-agent MDP framework where agents repeatedly solve a task in a collaborative setting. We study the problem of designing a learning algorithm for the first agent (A1) that facilitates a successful collaboration even in cases when the second agent (A2) is adapting its policy in an unknown way. The key challenge in our setting is that the first agent faces non-stationarity in rewards and transitions because of the adaptive behavior of the second agent. We design novel online learning algorithms for agent A1 whose regret decays as $O(T^{\max\{1-\frac{3}{7} \cdot α, \frac{1}{4}\}})$ with $T$ learning episodes provided that the magnitude of agent A2's policy changes between any two consecutive episodes are upper bounded by $O(T^{-α})$. Here, the parameter $α$ is assumed to be strictly greater than $0$, and we show that this assumption is necessary provided that the learning parity with noise problem is computationally hard. We show that sub-linear regret of agent A1 further implies near-optimality of the agents' joint return for MDPs that manifest the properties of a smooth game.

研究动机与目标

  • 设计一种学习算法,使智能体A₁在A₂的策略未知且持续变化的情况下,仍能维持在两智能体MDP中的有效协作。
  • 解决由于A₂行为演化导致的MDP中非平稳奖励与转移所带来的挑战。
  • 为A₁建立随学习回合数T增长而次线性衰减的理论遗憾边界。
  • 通过约化至噪声学习奇偶问题,证明假设策略变化速率𝒪(T⁻ᵅ)为必要条件。
  • 建立A₁的遗憾与满足平稳博弈性质的MDP中联合回报近似最优性之间的联系。

提出的方法

  • 该算法采用受Rakhlin & Sridharan(2013)和Syrgkanis等(2015)启发的近期性偏差专家学习框架,通过时间敏感加权方式动态调整Q值。
  • 将每个状态视为一个专家,通过近期性偏差加权聚合历史Q值,维护动作上的分布。
  • 在每个回合结束时,基于对A₂行为的观测,使用加权多数方法更新A₁的策略,以应对非平稳性。
  • 通过将问题约化至噪声学习奇偶问题,证明当α = 0时,次线性遗憾在计算上不可行。
  • 该方法确保当MDP满足博弈论中定义的平稳博弈性质时,遗憾边界可推出联合回报的近似最优性。

实验结果

研究问题

  • RQ1当第二智能体的策略随时间演化且其动态未知时,智能体能否在两智能体MDP中有效学习协作?
  • RQ2在何种策略变化速率(以T⁻ᵅ表示)下,学习智能体仍可实现次线性遗憾?
  • RQ3α > 0的假设是否对实现次线性遗憾是必要的?能否通过计算困难性证明这一结论?
  • RQ4智能体A₁的遗憾如何与合作MDP中联合回报的最优性相关联?
  • RQ5该框架能否扩展至在平稳博弈MDP条件下确保联合性能的近似最优?

主要发现

  • 在假设A₂的策略以𝒪(T⁻ᵅ)速率变化(α > 0)的前提下,所提算法在T个学习回合内实现遗憾上界𝒪(T^{max{1−(3/7)α, 1/4}})。
  • 策略变化速率𝒪(T⁻ᵅ)的上界是必要的,因为当α = 0时,次线性遗憾在计算上不可行,该结论通过约化至噪声学习奇偶问题得以证明。
  • 当MDP满足平稳博弈性质时,次线性遗憾可推出联合回报的近似最优性,符合博弈论中的定义。
  • 该算法通过将近期性偏差整合进专家学习框架,有效处理了非平稳的转移与奖励。
  • 该方法是首个在具有自适应智能体的合作性两智能体MDP中,提供此类遗憾与联合性能保证的算法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。