[论文解读] An Empirical Study on Hyperparameters and their Interdependence for RL Generalization
本文研究了深度强化学习(RL)中超参数之间的相互依赖性及其对泛化性能的影响,使用梯度余弦相似度(GCS)作为关键指标,分析训练-测试梯度对齐情况。研究发现,折扣因子(γ)、随机性以及正则化等超参数并非相互独立;其相互作用显著影响泛化性能,非单调的GCS模式通常可预测测试性能的不稳定性及较差结果。
Recent results in Reinforcement Learning (RL) have shown that agents with limited training environments are susceptible to a large amount of overfitting across many domains. A key challenge for RL generalization is to quantitatively explain the effects of changing parameters on testing performance. Such parameters include architecture, regularization, and RL-dependent variables such as discount factor and action stochasticity. We provide empirical results that show complex and interdependent relationships between hyperparameters and generalization. We further show that several empirical metrics such as gradient cosine similarity and trajectory-dependent metrics serve to provide intuition towards these results.
研究动机与目标
- 理解深度RL中超参数如何在独立调优之外影响泛化性能。
- 探究γ、随机性及正则化等超参数在泛化影响上是否正交或相互依赖。
- 评估轨迹相关指标(如梯度余弦相似度,GCS)在预测泛化失败方面的有效性。
- 评估GCS作为损失曲面平滑度与训练稳定性的代理指标的鲁棒性。
- 探索数据增强与奖励函数复杂度如何影响GCS作为泛化预测器的可靠性。
提出的方法
- 将RL泛化形式化为监督学习类比,其中训练与测试MDP从参数θ的分布中采样。
- 使用训练与测试策略梯度之间的梯度余弦相似度(GCS)作为主要指标,评估对齐程度与曲面平滑度。
- 采用PPO与策略梯度算法,并保持一致的超参数设置,以最小化GCS估计中的偏差。
- 测量梯度范数、方差及ℓ₂权重范数,以分析优化动力学与稳定性。
- 通过在观测中随机添加形状的方式实施数据增强,并分析其对梯度对齐的影响。
- 在CoinRun与RandomMazes等环境中,变化γ与随机性,以研究其对测试性能与GCS的联合影响。
实验结果
研究问题
- RQ1γ、动作随机性与正则化等超参数在影响RL泛化时如何相互作用?
- RQ2梯度余弦相似度(GCS)在多大程度上可作为RL测试性能不稳定的可靠预测指标?
- RQ3当奖励函数复杂度增加时,GCS与测试性能之间的相关性是否会减弱?
- RQ4随机性如何影响实现高性能所需γ值的可允许范围?
- RQ5轨迹相关指标(如GCS)能否检测到RL训练中过拟合或尖锐极小值的早期迹象?
主要发现
- 许多超参数并非相互正交;某一超参数对泛化的影响可能反转或改变另一超参数的单调性。
- 非单调递减的GCS模式与测试性能的不稳定性及性能下降强烈相关,通常在突然失败前出现。
- 即使在收敛前,随机性也能显著降低梯度范数,表明优化路径更具稳定性。
- 导致较差测试性能的较高γ值表明模型过拟合于训练分布,因智能体收敛于次优策略。
- 在迷宫等复杂环境中,随机性扩展了能获得高性能的γ值范围,表明探索能力与鲁棒性得到提升。
- 当奖励函数变得更复杂(如使用多层CNN时),GCS表现出单调递减,但与测试性能的相关性减弱,表明在高复杂度下GCS并非始终可靠。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。