[论文解读] Implicit Under-Parameterization Inhibits Data-Efficient Deep Reinforcement Learning
本文识别出基于值函数的深度强化学习中的'隐式参数不足'现象,即在使用bootstrapping的梯度下降过程中,神经网络特征的有效秩发生坍塌,导致模型表达能力下降并损害性能。作者在Atari和Gym环境中通过实证方法验证了该现象,并表明通过奇异值正则化控制秩坍塌可显著提升数据高效强化学习的性能,尤其在离线设置下效果更明显。
We identify an implicit under-parameterization phenomenon in value-based deep RL methods that use bootstrapping: when value functions, approximated using deep neural networks, are trained with gradient descent using iterated regression onto target values generated by previous instances of the value network, more gradient updates decrease the expressivity of the current value network. We characterize this loss of expressivity via a drop in the rank of the learned value network features, and show that this typically corresponds to a performance drop. We demonstrate this phenomenon on Atari and Gym benchmarks, in both offline and online RL settings. We formally analyze this phenomenon and show that it results from a pathological interaction between bootstrapping and gradient-based optimization. We further show that mitigating implicit under-parameterization by controlling rank collapse can improve performance.
研究动机与目标
- 识别并表征基于值函数的深度强化学习方法中一种此前未被解释的优化失败现象,这些方法使用bootstrapping。
- 证明在bootstrapped训练中重复的梯度更新会导致价值网络特征的有效秩下降,从而降低模型表达能力。
- 表明这种隐式参数不足会限制数据效率,尤其是在高数据重用的离线和在线强化学习设置中。
- 通过核模型和线性网络模型,正式分析秩坍塌背后的机制。
- 提出并验证一种简单的正则化方法,以控制秩坍塌并提升性能。
提出的方法
- 作者使用奇异值分解分析深度Q网络倒数第二层特征的有效秩。
- 引入一种有效秩度量 srankδ,用于量化学习到的特征的表达能力。
- 理论分析采用核回归和深度线性网络模型,表明bootstrapping与梯度下降结合会诱导病态的隐式正则化。
- 提出一种自训练论证,表明即使TD误差非零,由先前网络版本生成的目标也会降低特征秩。
- 在特征矩阵的奇异值上应用正则化惩罚,以在训练过程中防止秩坍塌。
- 在Atari和Gym基准上进行实验,涵盖在线和离线强化学习设置,以验证该现象及其缓解策略。
实验结果
研究问题
- RQ1为何基于值函数的深度强化学习方法在拥有高容量网络的情况下仍无法泛化?
- RQ2bootstrapping如何与梯度下降相互作用,从而降低深度Q网络的有效表达能力?
- RQ3在数据重用率高的数据高效和离线强化学习设置中,性能下降的原因是什么?
- RQ4是否可以通过奇异值正则化来量化并缓解特征表达能力的损失?
- RQ5隐式参数不足在深度强化学习训练动态中于何种条件下出现?
主要发现
- 在Atari和Gym环境的训练过程中,观察到价值网络特征的有效秩出现急剧下降,且该现象始终先于性能下降。
- 随着梯度更新次数增加和数据重用率提高,该现象更加严重,尤其在无新数据收集的离线强化学习中更为显著。
- 理论分析证实,bootstrapping与梯度下降结合会诱导一种病态的隐式正则化,从而降低特征秩。
- 在离线强化学习中,隐式参数不足表现稳定,限制了标准基于值函数方法的可行性。
- 对特征矩阵的奇异值施加正则化惩罚以控制秩坍塌,可在Atari环境的离线DQN和SAC中带来显著的性能提升。
- 在数据稀缺设置下,性能提升最为显著,表明控制隐式参数不足可增强数据效率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。