[论文解读] Curious Exploration and Return-based Memory Restoration for Deep Reinforcement Learning
本文提出了一种结合好奇探索(Curious Exploration)与基于回报的记忆恢复(Return-based Memory Restoration, RMR)的强化学习框架,仅使用二元成功/失败奖励,在稀疏奖励环境中训练智能体。通过利用基于好奇的探索与通过RMR优先处理有价值记忆,该方法使DDPG智能体能够在复杂的半场进攻足球模拟环境中可靠地学会得分,平均成功率达到97.8%,显著优于标准DDPG与仅使用好奇的基线方法。
Reward engineering and designing an incentive reward function are non-trivial tasks to train agents in complex environments. Furthermore, an inaccurate reward function may lead to a biased behaviour which is far from an efficient and optimised behaviour. In this paper, we focus on training a single agent to score goals with binary success/failure reward function in Half Field Offense domain. As the major advantage of this research, the agent has no presumption about the environment which means it only follows the original formulation of reinforcement learning agents. The main challenge of using such a reward function is the high sparsity of positive reward signals. To address this problem, we use a simple prediction-based exploration strategy (called Curious Exploration) along with a Return-based Memory Restoration (RMR) technique which tends to remember more valuable memories. The proposed method can be utilized to train agents in environments with fairly complex state and action spaces. Our experimental results show that many recent solutions including our baseline method fail to learn and perform in complex soccer domain. However, the proposed method can converge easily to the nearly optimal behaviour. The video presenting the performance of our trained agent is available at http://bit.ly/HFO_Binary_Reward.
研究动机与目标
- 解决在稀疏、二元成功/失败奖励环境中训练深度强化学习智能体的挑战,其中传统奖励塑造方法不切实际。
- 通过仅使用原始强化学习公式与环境提供的下一状态及二元奖励信号,消除对手工设计奖励函数的依赖。
- 通过增强探索与记忆保留,提高复杂动作与状态空间中的样本效率与学习收敛性。
- 证明智能体仅通过内在好奇与记忆优先化即可在HFO领域实现接近最优的行为,而无需任何奖励工程。
提出的方法
- 提出好奇探索(Curious Exploration),一种基于预测的探索策略,其中智能体通过学习的动力学模型中的预测误差,主动寻找新颖且不确定的状态。
- 采用基于回报的记忆恢复(RMR)机制,优先存储并重放具有高累积回报的经验,从而提高经验回放缓冲区中宝贵记忆的密度。
- 以标准DDPG算法作为策略学习的核心,仅基于原始强化学习公式运行,不进行任何奖励塑造。
- 训练一个状态动力学预测器,用于从当前状态与动作预测下一状态,并将预测误差用作内在好奇奖励。
- 应用RMR修改记忆存储策略,优先选择能带来更高回报的转移,从而保留关键的正向经验轨迹。
- 将内在好奇奖励与环境提供的二元奖励相结合,以在稀疏奖励环境中引导探索与学习。
实验结果
研究问题
- RQ1仅使用二元成功/失败奖励且无手工奖励塑造,DRL智能体是否能在半场进攻领域学会得分?
- RQ2与随机探索或标准DDPG相比,好奇探索在稀疏奖励环境中如何提升学习效率?
- RQ3基于回报的记忆恢复在多大程度上通过保留高回报经验提升了样本效率与学习收敛性?
- RQ4好奇与记忆恢复的结合是否能克服标准DDPG在稀疏奖励设置下的失败?
主要发现
- 仅使用二元奖励函数的DDPG智能体在五轮训练中完全失败,平均成功率为0.000。
- DDPG + 好奇探索(CE)智能体实现了91.9%的平均成功率,证明仅靠好奇即可在稀疏环境中提升学习效果。
- DDPG + CE + RMR智能体实现了97.8%的平均成功率,显著优于两个基线方法,并展现出更快收敛至最优行为。
- RMR机制有效保留了关键的正向经验轨迹,防止了对稀疏正向信号的早期遗忘,从而实现了稳定学习。
- 在首次触球与首次得分时刻,预测损失与探索奖励的峰值证实了好奇驱动智能体朝向关键任务相关行为发展。
- 该方法成功在复杂、高维的动作与状态空间环境中实现学习,无需任何奖励工程,仅依赖标准强化学习公式。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。