Skip to main content
QUICK REVIEW

[论文解读] Nonlinear Distributional Gradient Temporal-Difference Learning

Chao Qu, Shie Mannor|arXiv (Cornell University)|May 20, 2018
Model Reduction and Neural Networks参考文献 25被引用 10
一句话总结

本文提出了梯度时差学习的非线性分布变体——分布式GTD2、TDC和Greedy-GQ,利用Cramér距离优化价值分布而非价值期望。这些算法在一般平滑函数逼近器(包括神经网络)下可保证渐近几乎必然收敛至局部最优解,并在在线与离线策略设置下均展现出优于标准非分布式对应方法的稳定性和性能。

ABSTRACT

We devise a distributional variant of gradient temporal-difference (TD) learning. Distributional reinforcement learning has been demonstrated to outperform the regular one in the recent study \citep{bellemare2017distributional}. In the policy evaluation setting, we design two new algorithms called distributional GTD2 and distributional TDC using the Cram{é}r distance on the distributional version of the Bellman error objective function, which inherits advantages of both the nonlinear gradient TD algorithms and the distributional RL approach. In the control setting, we propose the distributional Greedy-GQ using the similar derivation. We prove the asymptotic almost-sure convergence of distributional GTD2 and TDC to a local optimal solution for general smooth function approximators, which includes neural networks that have been widely used in recent study to solve the real-life RL problems. In each step, the computational complexities of above three algorithms are linear w.r.t.\ the number of the parameters of the function approximator, thus can be implemented efficiently for neural networks.

研究动机与目标

  • 将分布式强化学习扩展至非线性函数逼近,在离线策略设置下实现理论保证。
  • 解决标准TD学习在离线策略场景下使用非线性函数逼近器时的不稳定性问题。
  • 开发理论基础扎实、稳定的算法,学习价值分布而非价值期望。
  • 弥合深度强化学习实践与分布式强化学习中理论收敛保证之间的差距。
  • 通过回报的分布表示提升样本效率与学习稳定性。

提出的方法

  • 使用Cramér距离度量预测值分布与目标值分布之间的差异,构建基于分布式贝尔曼误差的目标函数。
  • 将梯度时差框架适配至最小化投影后的Cramér距离,实现非线性函数逼近器下的收敛性。
  • 推导出基于随机梯度下降的分布式GTD2与TDC算法,用于策略评估。
  • 通过将Greedy-GQ目标扩展至分布式设置,并采用相同的Cramér距离度量,提出分布式Greedy-GQ算法用于控制。
  • 采用神经网络作为平滑函数逼近器,并确保每次更新的计算复杂度相对于网络参数为线性。
  • 实验中使用经验回放与离线策略数据收集,价值分布通过离散原子和Softmax输出层表示。

实验结果

研究问题

  • RQ1分布式强化学习能否在理论收敛保证下扩展至非线性函数逼近器?
  • RQ2在非线性设置下,最小化分布式贝尔曼误差中的Cramér距离是否比均方误差带来更稳定、更准确的学习?
  • RQ3在一般平滑函数逼近器下,分布式GTD2与TDC能否实现渐近收敛至局部最优解?
  • RQ4在样本效率与性能稳定性方面,分布式Greedy-GQ与标准DQN和C51相比表现如何?
  • RQ5学习完整的值分布是否能提升探索能力并降低离线策略深度强化学习中的方差?

主要发现

  • 在温和条件下,分布式GTD2与TDC即使在使用神经网络等非线性函数逼近器时,也能几乎必然收敛至局部最优解。
  • 在在线与离线策略环境中,分布式变体相比其非分布式对应方法展现出显著更低的方差与更稳定的训练曲线。
  • 在CartPole与LunarLander环境中,分布式Greedy-GQ在累积回报与稳定性方面优于DQN,并与C51持平或略胜一筹。
  • 在VizDoom环境中,分布式Greedy-GQ在训练7,000个回合后最终超越C51,表明其具备更强的长期学习能力。
  • 在离线策略设置下,分布式算法表现出更少振荡、更快收敛的稳定性能提升,MSPBE指标充分证实了这一点。
  • 采用离散原子与Softmax输出层表示的价值分布,能够有效建模多峰回报分布,从而增强学习稳定性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。