Skip to main content
QUICK REVIEW

[论文解读] Memory-efficient Reinforcement Learning with Value-based Knowledge Consolidation

Qingfeng Lan, Yangchen Pan|arXiv (Cornell University)|May 22, 2022
Machine Learning and ELM被引用 4
一句话总结

该论文提出MeDQN,一种内存高效的强化学习算法,通过将目标Q网络的知识通过整合损失传递到当前Q网络,减轻深度Q网络中的灾难性遗忘。在经验回放缓冲区至少比标准DQN小10倍的情况下,MeDQN在表格型和基于图像的环境中均实现了相当或更优的性能,显著降低了内存使用量,同时保持了高样本效率。

ABSTRACT

Artificial neural networks are promising for general function approximation but challenging to train on non-independent or non-identically distributed data due to catastrophic forgetting. The experience replay buffer, a standard component in deep reinforcement learning, is often used to reduce forgetting and improve sample efficiency by storing experiences in a large buffer and using them for training later. However, a large replay buffer results in a heavy memory burden, especially for onboard and edge devices with limited memory capacities. We propose memory-efficient reinforcement learning algorithms based on the deep Q-network algorithm to alleviate this problem. Our algorithms reduce forgetting and maintain high sample efficiency by consolidating knowledge from the target Q-network to the current Q-network. Compared to baseline methods, our algorithms achieve comparable or better performance in both feature-based and image-based tasks while easing the burden of large experience replay buffers.

研究动机与目标

  • 为解决在非独立同分布数据上训练时,由于内存容量有限而导致的灾难性遗忘问题。
  • 降低在设备端和边缘强化学习应用中大型经验回放缓冲区的内存负担。
  • 在不依赖大规模数据存储的前提下,保持高样本效率和学习稳定性。
  • 在持续强化学习设置中,以极低的内存开销实现有效的知识保留。

提出的方法

  • 引入一种知识整合损失,将目标Q网络中的价值函数知识传递到当前Q网络。
  • 使用可调超参数平衡学习新经验与保留旧知识。
  • 用均匀采样或真实状态采样替代大型经验回放缓冲区,将内存使用量减少最多10倍。
  • 在训练更新过程中应用整合损失,以稳定学习并减少遗忘。
  • 设计两种变体:MeDQN(U)用于均匀状态采样,MeDQN(R)用于真实状态采样,以适配不同任务类型。
  • 保持标准DQN架构,但修改学习目标以包含知识整合,从而保持与现有框架的兼容性。

实验结果

研究问题

  • RQ1能否通过从目标网络进行知识整合,在不依赖大型回放缓冲区的情况下减少DQN中的遗忘?
  • RQ2当使用10倍小的回放缓冲区时,MeDQN的性能与标准DQN相比如何?
  • RQ3知识整合是否能提升低维和高维控制任务中的样本效率和学习稳定性?
  • RQ4MeDQN能否在图像环境(如Atari和MinAtar)中以极低内存使用量维持性能?
  • RQ5在持续强化学习中,学习新知识与记忆旧知识之间的最优平衡是什么?

主要发现

  • 在三个Atari游戏中(Name This Game、Phoenix、Qbert),使用10万缓冲区的MeDQN(R)优于使用100万缓冲区的标准DQN。
  • 在Seaquest(MinAtar)中,MeDQN(R)使用10万缓冲区实现了25.82 ± 1.69的回报,优于DQN使用100万缓冲区时的20.48 ± 0.75。
  • 尽管仅使用10%的回放缓冲区内存,MeDQN(R)在另外两个Atari游戏中与DQN性能相当。
  • Atari游戏中内存使用量从7GB降低至0.7GB,证实了内存占用减少10倍且无性能下降。
  • MeDQN(U)和MeDQN(R)由于遗忘减少,计算效率得到提升,所需更新次数更少。
  • 该方法在极低内存开销下实现了SOTA性能,展示了在多样化环境中的强大鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。