Skip to main content
QUICK REVIEW

[论文解读] Dynamics Generalization via Information Bottleneck in Deep Reinforcement Learning

Xingyu Lu, Kimin Lee|arXiv (Cornell University)|Aug 3, 2020
Reinforcement Learning in Robotics参考文献 21被引用 17
一句话总结

本文提出了一种带有退火随机编码的信息瓶颈正则化方法,以提升深度强化学习中的泛化能力。通过约束观测与内部表征之间的信息流,该方法使智能体在测试动态下可泛化至训练分布之外超过10个标准差,显著优于基准方法,在迷宫导航和机器人控制任务中表现更优。

ABSTRACT

Despite the significant progress of deep reinforcement learning (RL) in solving sequential decision making problems, RL agents often overfit to training environments and struggle to adapt to new, unseen environments. This prevents robust applications of RL in real world situations, where system dynamics may deviate wildly from the training settings. In this work, our primary contribution is to propose an information theoretic regularization objective and an annealing-based optimization method to achieve better generalization ability in RL agents. We demonstrate the extreme generalization benefits of our approach in different domains ranging from maze navigation to robotic tasks; for the first time, we show that agents can generalize to test parameters more than 10 standard deviations away from the training parameter distribution. This work provides a principled way to improve generalization in RL by gradually removing information that is redundant for task-solving; it opens doors for the systematic study of generalization from training to extremely different testing settings, focusing on the established connections between information theory and machine learning.

研究动机与目标

  • 解决在面对未见过的环境动态时,深度强化学习中泛化能力差的关键挑战。
  • 通过在状态表征上施加信息瓶颈,防止DRL智能体记忆训练环境的观测。
  • 开发一种联合优化方案,当编码器与策略之间不满足分离原理时,仍能稳定训练。
  • 提升端到端强化学习策略中所学表征的可解释性与语义一致性。
  • 实现在具有动态变化的现实环境中稳健的仿真到现实迁移与部署。

提出的方法

  • 引入一种在观测与内部表征之间具有信息瓶颈的随机编码器,以限制冗余信息流。
  • 构建一个正则化的强化学习目标,其中包含观测与表征之间互信息的约束,由超参数β参数化。
  • 实施一种退火调度,逐步增加β,以渐进式压缩信息,从而稳定编码器与策略的联合优化。
  • 采用变分推理方法近似互信息约束,实现可微训练。
  • 将该方法应用于SAC和PPO等标准DRL架构,使其在不同环境中具备通用性。
  • 通过在测试时降低编码器的随机性,引入一种测试时适应策略,以避免异常表征。

实验结果

研究问题

  • RQ1信息瓶颈机制是否能在深度强化学习中实现超越标准正则化技术的泛化性能提升?
  • RQ2通过退火实现的渐进式信息压缩,如何影响在非可分强化学习设置下编码器与策略的联合优化?
  • RQ3信息瓶颈在多大程度上可使智能体泛化至训练分布之外超过10个标准差的环境动态?
  • RQ4所学的表征空间是否保留了语义结构,例如与最优评论器值的一致性?
  • RQ5该方法是否能提升仿真到现实迁移的性能与现实部署场景下的鲁棒性?

主要发现

  • 在β = 8e-3时,所提方法的平均测试奖励比基线高出30%,显著提升了泛化性能。
  • 在CartPole任务中,采用信息瓶颈训练的策略在测试参数上泛化至训练分布的10倍以上,全面优于基线。
  • 该方法生成的表征保留了与最优评论器值一致的距离关系,表明其具有语义可解释性与规划空间一致性。
  • 退火方案即使在分离原理不成立时,也能实现稳定的联合优化,避免了编码器与策略之间相互依赖的“鸡生蛋蛋生鸡”问题。
  • 在迷宫导航与机器人控制任务中,该方法在泛化性能上显著优于L2正则化与Dropout。
  • 可视化结果证实,编码器能将随机观测映射到有意义且结构化的潜在空间,从而增强策略的鲁棒性与可解释性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。