[论文解读] Tensor and Matrix Low-Rank Value-Function Approximation in Reinforcement Learning
本文提出了一种基于张量和矩阵低秩逼近的值函数(VF)估计方法,用于强化学习(RL),采用随机在线算法以降低样本复杂度和计算复杂度。通过将值函数表示为张量并应用PARAFAC分解,该方法在高维环境(如高速公路环境)中相比DQN和Q-learning实现了更快的收敛速度和更少的参数量。
Value-function (VF) approximation is a central problem in Reinforcement Learning (RL). Classical non-parametric VF estimation suffers from the curse of dimensionality. As a result, parsimonious parametric models have been adopted to approximate VFs in high-dimensional spaces, with most efforts being focused on linear and neural-network-based approaches. Differently, this paper puts forth a a parsimonious non-parametric approach, where we use stochastic low-rank algorithms to estimate the VF matrix in an online and model-free fashion. Furthermore, as VFs tend to be multi-dimensional, we propose replacing the classical VF matrix representation with a tensor (multi-way array) representation and, then, use the PARAFAC decomposition to design an online model-free tensor low-rank algorithm. Different versions of the algorithms are proposed, their complexity is analyzed, and their performance is assessed numerically using standardized RL environments.
研究动机与目标
- 通过利用低秩结构,解决非参数化值函数逼近中的维度灾难问题。
- 开发在线、无模型且参数稀疏的算法,利用低秩矩阵与张量分解来估计值函数。
- 通过张量表示将基于矩阵的低秩方法推广至多维状态-动作空间。
- 与DQN等深度强化学习基线方法相比,提升在高维环境中的样本效率与计算效率。
- 使高维强化学习问题中原本对经典方法不可行的非参数化、可解释的VF估计成为可能。
提出的方法
- 通过将状态-动作矩阵重塑为高阶数组,将值函数表示为张量(多维数组)。
- 应用PARAFAC(CANDECOMP)张量分解,在值函数张量上强制实现低秩结构。
- 开发基于时序差分学习原理的随机在线算法,用于更新低秩分量。
- 使用交替最小二乘法与增量更新策略,在在线学习过程中保持低秩结构。
- 提出多种算法变体,采用不同的秩和分辨率设置,以平衡精度与复杂度。
- 采用一种离散化策略,将连续状态-动作空间映射为适合张量表示的离散网格。
实验结果
研究问题
- RQ1低秩矩阵逼近是否能提升强化学习中在线值函数估计的样本效率与计算效率?
- RQ2在高维状态-动作空间中,基于张量的低秩表示相较于基于矩阵的方法与深度学习方法有何优势?
- RQ3张量秩与分辨率对标准强化学习环境中收敛速度与最终性能有何影响?
- RQ4随机在线低秩算法是否能在更少样本下实现比DQN和Q-learning更快的收敛速度?
- RQ5值函数的低秩结构在多大程度上实现了高维强化学习问题中高效、非参数化的学习?
主要发现
- 张量低秩(TLR)算法在批量大小为32时收敛速度超过DQN,且在大状态-动作空间中显著快于Q-learning。
- 在具有9维连续状态的高速公路环境中,TLR学习在参数更少且收敛更快的情况下仍优于DQN。
- 参数量更高的TLR算法实现了每集最高的回报与最快的收敛速度,而使用1样本小批量的DQN则陷入局部最优。
- DQN需要显著更多的样本才能达到与所提TLR方法相当的回报,表明其样本复杂度远高于TLR方法。
- 在所有标准环境中,TLR与MLR算法的每集平均步数均低于DQN与Q-learning。
- 累积奖励的分布显示,TLR与MLR始终优于Q-learning与DQN,尤其在高批量DQN设置下表现更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。