[论文解读] Posterior Sampling for Large Scale Reinforcement Learning
本文提出确定性调度后验抽样强化学习(DS-PSRL),一种适用于大规模和连续MDP的实用、模型无关算法,采用对数尺度的确定性回合切换调度。在温和假设下,其贝叶斯后悔界与状态空间大小无关,从而实现高效泛化,并在离散与连续控制问题上优于最先进PSRL方法。
We propose a practical non-episodic PSRL algorithm that unlike recent state-of-the-art PSRL algorithms uses a deterministic, model-independent episode switching schedule. Our algorithm termed deterministic schedule PSRL (DS-PSRL) is efficient in terms of time, sample, and space complexity. We prove a Bayesian regret bound under mild assumptions. Our result is more generally applicable to multiple parameters and continuous state action problems. We compare our algorithm with state-of-the-art PSRL algorithms on standard discrete and continuous problems from the literature. Finally, we show how the assumptions of our algorithm satisfy a sensible parametrization for a large class of problems in sequential recommendations.
研究动机与目标
- 解决现实应用中常见的非回合制、非重置MDP缺乏实用且可扩展的PSRL算法的问题,例如序列推荐。
- 克服现有PSRL方法依赖表格表示和基于访问次数的动态回合调度的局限性,这些方法在连续或高维状态-动作空间中不可行。
- 开发一种通用PSRL算法,具备可证明的贝叶斯后悔保证,适用于参数化MDP,特别是具有标量参数的情形。
- 在保持强理论性能保证的同时,展示算法在样本、时间和空间复杂度上的实际可行性和高效性。
- 证明算法的假设在广泛的一类序列推荐系统中成立,从而实现数据高效、非短视的个性化。
提出的方法
- 提出一种基于对数尺度回合长度增长的确定性、模型无关的回合切换调度,消除对访问次数等动态统计量的依赖。
- 在每个回合开始时从后验分布中采样一个模型,并在该回合内执行该采样模型的最优策略,直至回合结束。
- 采用参数化模型,其中系统动态依赖于一个标量参数(例如用户听音乐的倾向),从而实现在状态和动作间的泛化。
- 利用利普希茨连续性和后验集中假设,推导出与状态空间大小无关的后悔界。
- 利用参数化MDP的结构,避免对每个状态-动作对进行计数,从而实现对连续和高维问题的可扩展性。
- 采用非回合制、持续学习框架,无需状态重置,适用于现实世界应用如推荐系统。
实验结果
研究问题
- RQ1能否设计一种PSRL算法,使其在大规模、连续且非回合制MDP中兼具理论严谨性和实际高效性?
- RQ2基于对数尺度回合长度增长的确定性回合切换调度,是否能在不依赖访问次数等动态统计量的情况下,实现强后悔保证?
- RQ3当MDP动态由标量参数参数化时,DS-PSRL的后悔界是否可独立于状态数量?
- RQ4利普希茨动态和后验集中假设在现实世界序列推荐系统中在多大程度上成立?
- RQ5在连续和离散控制任务中,DS-PSRL在样本效率和累积后悔方面与最先进PSRL算法相比如何?
主要发现
- 在温和假设下,DS-PSRL实现贝叶斯后悔界为Õ(HS√(AT)),当动态由标量参数化时,该界与状态数量无关。
- 该算法在标准离散和连续控制问题(包括线性二次调节器LQR和POI推荐任务)上优于最先进PSRL方法。
- 实验结果表明,DS-PSRL能快速学习最优参数(如A*, B*),每时间步切换回合的表现良好,表明对多步探索的需求极低。
- 带有扰动转移概率的POI推荐模型满足利普希茨动态和后验集中假设,且‖P(⋅|X,a,θ)−P(⋅|X,a,θ′)‖₁ ≤ (2/e)|θ−θ′|。
- 真实参数θ*的期望平方估计误差有界:maxⱼ𝔼[Nⱼ₋₁|θ*−θ̃ⱼ|²] = O(1),在温和条件下确认了后验集中。
- 该算法的确定性调度确保回合长度对数增长,从而实现高效的时间、样本和空间复杂度,适用于大规模和连续问题。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。