[论文解读] A Comparative Analysis of Expected and Distributional Reinforcement Learning
本文在表格、线性和非线性函数逼近设置下比较了期望型与分布型强化学习。结果表明,在表格和线性设置中,分布型方法通常与期望型方法等价,但在非线性函数逼近下二者出现分歧——此时分布型方法因优化和正则化性能的提升而优于期望型方法,尤其体现在C51中的Softmax机制以及深度网络中的特征学习方面。
Since their introduction a year ago, distributional approaches to reinforcement learning (distributional RL) have produced strong results relative to the standard approach which models expected values (expected RL). However, aside from convergence guarantees, there have been few theoretical results investigating the reasons behind the improvements distributional RL provides. In this paper we begin the investigation into this fundamental question by analyzing the differences in the tabular, linear approximation, and non-linear approximation settings. We prove that in many realizations of the tabular and linear approximation settings, distributional RL behaves exactly the same as expected RL. In cases where the two methods behave differently, distributional RL can in fact hurt performance when it does not induce identical behaviour. We then continue with an empirical analysis comparing distributional and expected RL methods in control settings with non-linear approximators to tease apart where the improvements from distributional RL methods are coming from.
研究动机与目标
- 探究为何尽管理论依据有限,分布型强化学习(DRL)在深度强化学习中仍优于期望型强化学习(ERL)。
- 确定在表格和线性函数逼近设置下,分布型方法与期望型方法的行为是否不同。
- 通过比较不同函数逼近范式下的性能,分离出DRL经验成功的主要原因。
- 评估Softmax和分布型投影等特定组件在DRL性能提升中的作用。
提出的方法
- 对表格和线性函数逼近设置进行理论分析,以比较DRL与ERL的行为差异。
- 通过SARSA和DQN变体(DQN、C51、S51-lite)结合傅里叶基特征,在CartPole和Acrobot环境中进行实证评估。
- 使用逐渐增加傅里叶基阶数的线性函数逼近,以评估特征表达能力的影响。
- 将傅里叶特征替换为两层ReLU神经网络,以研究非线性函数逼近的影响。
- 实现S51-lite,采用CDF和PMF投影以比较分布型更新机制。
- 使用Adam优化器并进行超参数调优,以确保不同算法之间的公平比较。
实验结果
研究问题
- RQ1在表格和线性函数逼近设置下,分布型与期望型强化学习方法是否行为一致?
- RQ2在何种条件下分布型RL会偏离期望型RL,且这种偏离是否提升性能?
- RQ3非线性函数逼近在分布型RL观察到的性能增益中起到何种作用?
- RQ4Softmax等特定组件或分布型投影机制如何影响学习效率和最终性能?
- RQ5分布型视角的优势主要源于正则化、辅助监督,还是深度网络中优化的改进?
主要发现
- 在表格和线性函数逼近设置中,当分布型更新保持期望值不变时,分布型RL与期望型RL行为完全一致,表明在这些设置下不存在固有优势。
- 当分布型更新不保持期望值时(如S51-lite中使用PMF),性能可能下降,表明分布型建模并不总能改善学习。
- 在使用深度网络进行非线性函数逼近时,C51在CartPole和Acrobot环境中均优于DQN,表明分布型方法在非线性设置中具有优势。
- S51-lite使用PMF时性能显著劣于DQN和C51,表明分布型投影机制的选择至关重要,且C51中的Softmax在正则化中起关键作用。
- 在低维特征空间(如二阶傅里叶基)中,分布型方法表现劣于DQN,表明分布型方法对特征表示质量更敏感。
- 分布型RL在深度强化学习中的性能增益主要源于非线性函数逼近器中优化与正则化的改进,尤其体现在C51中的Softmax机制以及深层网络的特征学习能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。