[论文解读] Nonstationary Reinforcement Learning with Linear Function Approximation
本文提出了LSVI-UCB-Restart和Ada-LSVI-UCB-Restart算法,用于在奖励和转移概率随时间演变的非平稳马尔可夫决策过程(episodic MDPs)中进行线性函数逼近的非平稳强化学习。在环境动态变化的总变差有界的条件下,建立了次线性动态遗憾界,证明了极小化最大遗憾下界,并通过理论和实验展示了近似最优性。
We consider reinforcement learning (RL) in episodic Markov decision processes (MDPs) with linear function approximation under drifting environment. Specifically, both the reward and state transition functions can evolve over time but their total variations do not exceed a $ extit{variation budget}$. We first develop $ exttt{LSVI-UCB-Restart}$ algorithm, an optimistic modification of least-squares value iteration with periodic restart, and bound its dynamic regret when variation budgets are known. Then we propose a parameter-free algorithm $ exttt{Ada-LSVI-UCB-Restart}$ that extends to unknown variation budgets. We also derive the first minimax dynamic regret lower bound for nonstationary linear MDPs and as a byproduct establish a minimax regret lower bound for linear MDPs unsolved by Jin et al. (2020). Finally, we provide numerical experiments to demonstrate the effectiveness of our proposed algorithms.
研究动机与目标
- 解决在奖励和转移函数随时间变化的非平稳环境中设计统计高效强化学习算法的挑战。
- 克服在线广告和自主系统等现实应用中用户偏好和动态演变导致的平稳强化学习假设的局限性。
- 在环境动态变化的总变差有界的条件下,为具有线性函数逼近的回合制MDP设计实现次线性动态遗憾的算法。
- 提供理论保证,包括非平稳线性MDP的极小化最大动态遗憾下界,证明所提方法的近似最优性。
- 设计一种无需参数的算法(Ada-LSVI-UCB-Restart),可自适应调整重启间隔,无需预先知晓环境漂移的预算。
提出的方法
- 提出LSVI-UCB-Restart,作为最小二乘值迭代(LSVI)的乐观变体,结合周期性策略重启,以适应漂移环境。
- 在非平稳条件下,使用值函数估计的上置信界(UCB)来平衡探索与利用。
- 引入变化预算约束,量化奖励和转移函数随时间的总漂移,从而支持遗憾分析。
- 提出Ada-LSVI-UCB-Restart作为无需参数的扩展,可自适应调整重启间隔,无需知晓变化预算。
- 利用线性MDP结构,其中真实值函数在已知特征映射下为线性,实现高效的函数逼近。
- 应用矩阵集中不等式和自归一化鞅界限,控制时变动态下的估计误差。
实验结果
研究问题
- RQ1我们能否为具有线性函数逼近的非平稳MDP设计一种统计高效的强化学习算法,实现次线性动态遗憾?
- RQ2在总变差有界的非平稳线性MDP中,动态遗憾的根本极限(极小化最大遗憾下界)是什么?
- RQ3我们如何设计一种无需参数的算法,使其能自适应未知水平的环境漂移?
- RQ4基于乐观性的方法结合周期性重启,能否有效处理线性MDP中随时间变化的奖励和转移函数?
- RQ5我们能否在非平稳强化学习与函数逼近的背景下,建立在对数因子内紧致的动态遗憾理论保证?
主要发现
- 当奖励和转移函数的总变差预算 $ B $ 已知时,所提出的LSVI-UCB-Restart算法实现了动态遗憾界 $ O(B^{1/3} d^{2/3} H^{1/3} T^{2/3}) $。
- Ada-LSVI-UCB-Restart算法在无需预先知晓 $ B $ 的情况下,实现了略差的动态遗憾界 $ O(B^{1/3} d^{2/3} H^{1/3} T^{2/3} \text{polylog}(T)) $,使其能够自适应未知漂移。
- 本文建立了非平稳线性MDP的极小化动态遗憾下界 $ \Omega(B^{1/3} d^{2/3} H^{1/3} T^{2/3}) $,证明所提算法在对数因子内近似最优。
- 理论分析首次为线性MDP提供了极小化最大遗憾下界,解决了先前工作[1]遗留的开放问题。
- 在包含15个状态、7个动作、10个时间步长和10维特征的合成非平稳线性MDP上的数值实验,验证了所提算法在突发和渐变环境变化下的有效性。
- 结果表明,两种算法均能有效适应变化的环境,且Ada-LSVI-UCB-Restart在变化预算未知时仍保持强劲性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。