Skip to main content
QUICK REVIEW

[论文解读] Whittle index based Q-learning for restless bandits with average reward

Konstantin Avrachenkov, Vivek S. Borkar|arXiv (Cornell University)|Apr 29, 2020
Advanced Bandit Algorithms Research被引用 5
一句话总结

该论文提出了一种基于Whittle指数的Q-learning算法,用于平均奖励的 restless bandits 问题,利用Whittle指数结构显著缩小Q-learning的搜索空间。该方法采用双时间尺度随机逼近,几乎必然收敛到真实的Whittle指数,实现了显著的计算效率和大规模问题上的强大经验性能。

ABSTRACT

A novel reinforcement learning algorithm is introduced for multiarmed restless bandits with average reward, using the paradigms of Q-learning and Whittle index. Specifically, we leverage the structure of the Whittle index policy to reduce the search space of Q-learning, resulting in major computational gains. Rigorous convergence analysis is provided, supported by numerical experiments. The numerical experiments show excellent empirical performance of the proposed scheme.

研究动机与目标

  • 解决由于状态空间指数级增长,将原始Q-learning应用于restless bandits时计算不可行的问题。
  • 通过在线学习指数而无需事先掌握系统知识,克服Whittle指数策略中的“建模困境”。
  • 设计一种强化学习方案,利用Whittle指数可索引性的结构特性,降低学习复杂度。
  • 利用双时间尺度随机逼近,在平均奖励设置下,为学习Whittle指数提供严格的收敛保证。
  • 即使在具有大量动作臂的大规模系统中,也能实现计算开销极小的高效在线和离线学习。

提出的方法

  • 将平均奖励的Q-learning与Whittle指数策略结构相结合,将动作空间约束为基于指数的决策。
  • 采用双时间尺度随机逼近:快速更新Q值,慢速更新Whittle指数,学习率满足标准收敛条件。
  • 将Whittle指数学习更新定义为对满足指数等式条件的增量调整:$ Q^*_{\lambda}(\hat{k},1) = Q^*_{\lambda}(\hat{k},0) $。
  • 利用Whittle指数是唯一使被动动作与主动动作下最优成本相等的$ \lambda $这一事实。
  • 应用双时间尺度随机逼近理论(如Borkar, 2008)证明指数估计的几乎必然收敛性。
  • 通过引理2和引理3确保迭代过程有界,并验证其ODE极限在真实Whittle指数处具有唯一全局渐近稳定平衡点。

实验结果

研究问题

  • RQ1能否设计出基于Whittle指数的Q-learning算法,使其在平均奖励设置下几乎必然收敛到真实的Whittle指数?
  • RQ2如何通过利用Whittle指数可索引性,降低restless bandits问题中Q-learning的计算复杂度?
  • RQ3在双时间尺度随机逼近框架下,何种学习率条件可确保Whittle指数估计的收敛性?
  • RQ4所提出的算法能否在保持收敛性和效率的前提下,同时处理i.i.d.与非i.i.d.的臂动态?
  • RQ5与先前工作相比,该方法在大规模问题上的收敛性保证和经验性能表现如何?

主要发现

  • 在标准假设下,所提算法实现了对所有状态$ \hat{k} \in S $的估计Whittle指数$ \lambda_n(\hat{k}) $几乎必然收敛到真实指数$ \lambda(\hat{k}) $。
  • 对于$ N = 100 $个臂、每臂$ d_\alpha = 5 $个状态的情况,该算法每轮迭代仅需5,500次更新,而原始Q-learning需$ 10^{100} $次更新。
  • 该方法计算高效,即使在标准设备上也能处理大规模系统,而经典Q-learning在这些场景下不可行。
  • 数值实验表明其具有出色的实证性能,验证了理论上的收敛性和效率优势。
  • 该算法支持在线和离线学习模式,包括离策略更新,显著增强了实际适用性。
  • 收敛性证明严谨,基于双时间尺度随机逼近理论,并验证了Borkar(2008)提出的全部假设(A1–A7)。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。