Skip to main content
QUICK REVIEW

[论文解读] On the Generalization Gap in Reparameterizable Reinforcement Learning

Huan Wang, Stephan Zheng|arXiv (Cornell University)|May 29, 2019
Reinforcement Learning in Robotics被引用 14
一句话总结

本文通过重参数化技巧将可重参数化的强化学习与监督学习联系起来,建立了理论泛化边界,实现了Rademacher和PAC-Bayes分析。结果表明,泛化差距取决于环境转移、奖励以及策略函数类的平滑性,经验验证显示在更平滑的动力学和更低的Lipschitz常数下,泛化差距减小。

ABSTRACT

Understanding generalization in reinforcement learning (RL) is a significant challenge, as many common assumptions of traditional supervised learning theory do not apply. We focus on the special class of reparameterizable RL problems, where the trajectory distribution can be decomposed using the reparametrization trick. For this problem class, estimating the expected return is efficient and the trajectory can be computed deterministically given peripheral random variables, which enables us to study reparametrizable RL using supervised learning and transfer learning theory. Through these relationships, we derive guarantees on the gap between the expected and empirical return for both intrinsic and external errors, based on Rademacher complexity as well as the PAC-Bayes bound. Our bound suggests the generalization capability of reparameterizable RL is related to multiple factors including "smoothness" of the environment transition, reward and agent policy function class. We also empirically verify the relationship between the generalization gap and these factors through simulations.

研究动机与目标

  • 为解决策略梯度强化学习中缺乏有限样本泛化保证的问题,特别是过拟合和分布偏移问题。
  • 识别一类可重参数化的强化学习问题,其中可通过重参数化技巧解耦轨迹分布,从而实现理论分析。
  • 利用Rademacher复杂度和PAC-Bayes理论,为内在(类似过拟合)和外部(分布偏移)误差推导泛化边界。
  • 通过实验验证泛化差距与策略平滑性、转移函数平滑性和模型复杂度等因素之间的关系。

提出的方法

  • 使用重参数化技巧将轨迹表示为外围随机变量的确定性函数,从而将策略依赖性与环境随机性解耦。
  • 应用Rademacher复杂度和PAC-Bayes边界,为可重参数化MDP中的期望回报与经验回报之间的有限样本泛化保证提供理论推导。
  • 将策略和环境动态建模为具有有界Lipschitz常数的函数类,使用权重范数作为平滑性的代理指标。
  • 通过随机梯度优化方法,评估在不同策略平滑性(通过softmax中的温度调节)、转移平滑性和模型规模下的泛化差距。
  • 引入对初始状态和转移分布的受控扰动(通过Rademacher噪声),以测量在分布偏移下的外部泛化差距。
  • 使用Adam优化器配合学习率衰减,并报告每个配置下100次试验的结果,以确保统计稳定性。

实验结果

研究问题

  • RQ1当标准监督学习假设不适用时,如何对策略梯度强化学习中的泛化行为进行理论分析?
  • RQ2在可重参数化的强化学习中,泛化差距与策略、环境转移和奖励函数的平滑性之间存在何种关系?
  • RQ3Rademacher复杂度和PAC-Bayes边界能否有效应用于可重参数化强化学习,以推导有限样本泛化保证?
  • RQ4初始状态或转移动态的分布偏移如何影响强化学习中的泛化差距,且该影响能否被边界约束?
  • RQ5模型容量和优化超参数在多大程度上影响可重参数化强化学习中的泛化差距?

主要发现

  • 随着策略变得更平滑,泛化差距减小:当策略的Lipschitz常数度量(1/τ ∏‖θˡ‖F)从65.6k降低到131.3k时,平均泛化差距减少20%。
  • 当初始化噪声尺度ζ从1增加到10时,平均泛化差距从0.481降至0.477,表明在更平滑的策略下,对初始状态偏移的敏感性降低。
  • 转移分布偏移导致泛化差距急剧上升:当ζ从1增加到1,000时,泛化差距从11飙升至73,300,表明误差随时间步长显著累积。
  • 当通过温度τ提高转移平滑性(T₁)时,泛化差距随τ从1增加到100而从0.336降至0.214,证实了平滑性在降低泛化误差中的作用。
  • 更大的模型表现出更高的泛化差距:当模型参数从65.6k增至110万时,泛化差距从0.204上升至0.418,表明即使在可重参数化设置下,模型容量也可能加剧过拟合。
  • 实验结果验证了理论主张:泛化性能强烈受策略和环境动态平滑性的影响,尤其在分布偏移条件下更为显著。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。