Skip to main content
QUICK REVIEW

[论文解读] Reinforcement Learning Generalization with Surprise Minimization

Jerry Zikun Chen|arXiv (Cornell University)|Apr 26, 2020
Reinforcement Learning in Robotics参考文献 28被引用 8
一句话总结

本文提出一种基于变分自编码器(VAE)的惊喜最小化奖励,以提升深度强化学习(RL)在程序化生成环境中的泛化能力。通过在状态轨迹上训练VAE以预测未来状态并最小化预测惊喜,智能体学习到更鲁棒、更稳定的策略,从而在ProcGen基准测试中对未见过的测试关卡表现出更好的泛化性能,训练速度和测试表现均优于标准PPO,但在CoinRun中因模型表示能力过强而出现过拟合。

ABSTRACT

Generalization remains a challenging problem for deep reinforcement learning algorithms, which are often trained and tested on the same set of deterministic game environments. When test environments are unseen and perturbed but the nature of the task remains the same, generalization gaps can arise. In this work, we propose and evaluate a surprise minimizing agent on a generalization benchmark to show an additional reward learned from a simple density model can show robustness in procedurally generated game environments that provide constant source of entropy and stochasticity.

研究动机与目标

  • 解决深度RL智能体在未见过的程序化生成环境中测试时的泛化差距问题。
  • 探究通过学习的密度模型最小化未来惊喜是否能提升在熵高、随机性强环境中的鲁棒性。
  • 评估惊喜最小化作为内在奖励信号在提升泛化能力方面相对于标准RL算法的有效性。
  • 探索不同密度模型及奖励缩放超参数对泛化性能的影响。

提出的方法

  • 在智能体经验中在线训练变分自编码器(VAE),基于其经验中的状态观测,以建模当前策略下的边际状态分布。
  • VAE为每个状态输出潜在分布(均值与方差),从而估计状态重建概率,进而计算惊喜。
  • 惊喜通过重建状态的负对数似然计算,作为内在奖励信号,以最小化未来的预测误差。
  • 通过超参数α将惊喜奖励与任务奖励结合,以平衡内在与外在学习目标。
  • VAE与策略以批处理、在线方式联合训练,每轮训练步骤使用相同的体验批次同时更新两者。
  • 该方法在ProcGen基准的两款游戏(CoinRun与BossFight)上进行评估,采用标准PPO训练流程。

实验结果

研究问题

  • RQ1通过学习的密度模型实现惊喜最小化,是否能提升深度强化学习在程序化生成环境中的泛化能力?
  • RQ2与标准PPO相比,惊喜最小化奖励在未见过关卡上的测试性能如何?
  • RQ3密度模型的选择(如VAE与高斯分布)是否影响泛化性能与鲁棒性?
  • RQ4控制惊喜奖励强度的超参数α如何影响任务学习与泛化之间的平衡?
  • RQ5内在惊喜信号在训练与测试过程中如何帮助智能体适应环境的熵?

主要发现

  • 在CoinRun中,惊喜最小化奖励显著加快了学习速度,PPO + VAE在训练初期即达到比基线PPO更高的任务奖励。
  • 在BossFight环境中,PPO + VAE智能体在经历初期过拟合后,最终在测试集上的表现与标准PPO相当,表明泛化能力得到最终提升。
  • 在CoinRun中,由于VAE的高表示能力,PPO + VAE智能体在训练关卡上出现过拟合,尽管训练更快,但测试性能反而更差。
  • 当惊喜奖励与任务奖励保持平衡时,惊喜奖励效果最佳;若惊喜信号过强,则性能下降。
  • 该方法表明,内在惊喜最小化可通过鼓励稳定、可预测的行为,提升在高熵环境中的鲁棒性。
  • 结果表明,惊喜最小化在需要持续生存的任务(如BossFight)中更有效,而在目标导向型任务(如CoinRun)中效果较弱,因后者更易导致记忆化行为。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。