[论文解读] Fast deep reinforcement learning using online adjustments from the past
本文提出了一种名为瞬时价值调整(Ephemeral Value Adjustments, EVA)的方法,使深度强化学习智能体能够通过重放缓冲区中近期经验的记忆式规划,快速适应价值函数预测。通过结合情景记忆检索与在线价值调整,EVA在不修改底层DQN架构或超参数的前提下,提升了Atari游戏上的学习速度与最终性能,在4000万帧内达到基线表现。
We propose Ephemeral Value Adjusments (EVA): a means of allowing deep reinforcement learning agents to rapidly adapt to experience in their replay buffer. EVA shifts the value predicted by a neural network with an estimate of the value function found by planning over experience tuples from the replay buffer near the current state. EVA combines a number of recent ideas around combining episodic memory-like structures into reinforcement learning agents: slot-based storage, content-based retrieval, and memory-based planning. We show that EVAis performant on a demonstration task and Atari games.
研究动机与目标
- 解决深度强化学习智能体在重放缓冲区中对高回报经验适应缓慢的问题。
- 通过利用过往经验实现快速、局部的价值函数调整,提升样本效率,同时不改变主学习算法。
- 结合快速的情景控制与缓慢的、泛化的无模型学习,受神经科学中互补学习系统启发。
- 证明瞬时的、非持久的价值调整可显著加速学习过程,同时保持训练稳定性。
提出的方法
- EVA在重放缓冲区中存储轨迹指针与隐藏激活,以支持对时间上相邻经验的内存式规划。
- 它使用参数化相似度度量进行在线规划,检索相关过往经验并估计价值函数的改进。
- 该方法通过基于轨迹的值调整,结合轨迹上的动作评估与反事实动作评估,提升价值估计的准确性。
- 该调整是瞬时的——仅在决策时应用,不被存储,从而保持主价值函数更新的稳定性。
- EVA通过在推理时修改深度网络输出的加权组合,与标准DQN集成,其中包含 episodic plan 的贡献。
- 该方法使用超参数 λ 来平衡情景调整对最终动作选择的贡献。
实验结果
研究问题
- RQ1基于情景记忆的规划能否在不修改核心训练过程的前提下,提升深度强化学习智能体的样本效率?
- RQ2与标准的基于梯度的更新相比,在线瞬时价值调整在学习速度与最终性能方面表现如何?
- RQ3在情景规划过程中引入反事实动作评估对策略稳定性与性能有何影响?
- RQ4基于记忆的规划是否能改善重放缓冲区中的数据分布,从而间接提升主价值函数?
- RQ5调整的瞬时性质是否能防止负面反馈循环并维持训练稳定性?
主要发现
- 与标准DQN相比,EVA在Atari游戏上提升了学习速度与最终性能,在4000万帧内达到基线表现水平。
- 在消融实验中,若省略反事实动作评估的n步轨迹计算,性能显著下降且出现不稳定,表明该组件至关重要。
- 使用参数化相似度的标准轨迹计算优于计算成本更高的KBRL方法,表明更简单的场景规划已足够且更稳定。
- 当λ=0.4时,EVA在多个游戏中获得优于标准DQN(λ=0)的人类归一化得分,且性能方差更低。
- 在两百万步内将λ衰减至零,未导致性能下降,证实参数化模型可无需持续依赖EVA即可整合情景知识。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。