[论文解读] Accelerated Gradient Temporal Difference Learning
本文提出加速梯度时序差分(ATD),一种新型的次二次时间差分学习算法家族,其数据效率与最小二乘时序差分(LSTD)相当,同时保持线性计算和存储成本。ATD 使用拟牛顿预处理矩阵加速收敛,并确保渐近无偏性,与线性TD方法相比,显著降低了对超参数的敏感度。
The family of temporal difference (TD) methods span a spectrum from computationally frugal linear methods like TD(λ) to data efficient least squares methods. Least square methods make the best use of available data directly computing the TD solution and thus do not require tuning a typically highly sensitive learning rate parameter, but require quadratic computation and storage. Recent algorithmic developments have yielded several sub-quadratic methods that use an approximation to the least squares TD solution, but incur bias. In this paper, we propose a new family of accelerated gradient TD (ATD) methods that (1) provide similar data efficiency benefits to least-squares methods, at a fraction of the computation and storage (2) significantly reduce parameter sensitivity compared to linear TD methods, and (3) are asymptotically unbiased. We illustrate these claims with a proof of convergence in expectation and experiments on several benchmark domains and a large-scale industrial energy allocation domain.
研究动机与目标
- 解决时序差分学习中计算效率与数据效率之间的权衡问题。
- 开发一种方法,实现与最小二乘时序差分(LSTD)相当的数据效率,同时避免二次计算或存储需求。
- 降低线性TD方法中常见的超参数敏感度,特别是对学习率的敏感度。
- 在次二次近似中确保渐近无偏性,这与许多先前的次二次方法不同。
- 为大规模和高维问题提供实用的、完全增量式的策略评估方法。
提出的方法
- 提出加速梯度时序差分(ATD),一种类拟牛顿风格的随机梯度下降方法,通过近似均方投影贝尔曼误差(MSPBE)的海森矩阵对时序差分更新进行预处理。
- 使用预处理矩阵的低秩近似,以保持次二次的计算和存储复杂度。
- 将更新公式化为一种修改后的梯度下降步骤,其中预处理矩阵加速收敛至TD固定点。
- 证明即使使用低秩近似,其期望收敛至真实TD解。
- 将预处理矩阵集成到适用于在线、实时学习的增量更新规则中。
- 证明该方法无论近似秩如何(包括秩为一),均保持一致性和无偏性。
实验结果
研究问题
- RQ1次二次时序差分方法能否在保持低计算和存储成本的同时,实现与LSTD相当的数据效率?
- RQ2与标准线性TD方法相比,使用预处理梯度更新是否能降低对学习率等超参数的敏感度?
- RQ3预处理矩阵的低秩近似能否在值函数估计中保持渐近无偏性?
- RQ4ATD在性能和鲁棒性方面与现有次二次方法(如tLSTD、iLSTD和随机投影LSTD)相比如何?
- RQ5ATD能否在高维或噪声特征空间中保持快速收敛和低误差?
主要发现
- ATD 在显著降低计算和存储需求的同时,实现了与LSTD相当的数据效率,在基准领域中表现出更快的初始学习速度。
- ATD 对正则化参数的敏感度极低,而线性TD方法则通常需要大量超参数调优。
- 即使预处理矩阵的秩低至1,ATD 仍保持渐近无偏性,而tLSTD和其他次二次方法则引入偏差。
- 在具有8192维特征的大规模工业能源分配领域中,ATD 在低秩设置(r=40)下优于tLSTD,展现出更优的鲁棒性和效率。
- 在包含100个额外随机特征的噪声特征设置(如Mountain Car)中,ATD 通过其低秩近似有效忽略了不可靠特征,同时保持了强劲性能。
- ATD 实现了与真实在线TD(λ)和ETD(λ)相当的性能,且无需进行大量参数调优,而线性方法则通常需要高度调优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。