[论文解读] Expert-augmented actor-critic for ViZDoom and Montezumas Revenge
本文提出了一种专家增强的演员-critic方法,将ACKTR与基于预录专家轨迹的监督学习相结合,以改善稀疏奖励环境中的探索。该方法在Montezuma’s Revenge上实现了最先进性能,得分稳定超过27,000分,并在部分运行中超越了专家数据;同时在ViZDoom的MyWayHome迷宫中实现了高效的无课程学习。
We propose an expert-augmented actor-critic algorithm, which we evaluate on two environments with sparse rewards: Montezumas Revenge and a demanding maze from the ViZDoom suite. In the case of Montezumas Revenge, an agent trained with our method achieves very good results consistently scoring above 27,000 points (in many experiments beating the first world). With an appropriate choice of hyperparameters, our algorithm surpasses the performance of the expert data. In a number of experiments, we have observed an unreported bug in Montezumas Revenge which allowed the agent to score more than 800,000 points.
研究动机与目标
- 为解决强化学习中稀疏奖励带来的挑战,其中随机探索效率低下且样本效率差。
- 改善Montezuma’s Revenge和ViZDoom的MyWayHome等环境中样本效率与探索能力,这些环境因稀疏奖励而阻碍学习。
- 开发一种实用方法,将专家演示整合进无需迭代专家交互的端到端模型无关演员-critic框架中。
- 评估专家增强学习是否能在需要高级规划且奖励稀疏的环境中超越专家表现。
提出的方法
- 该方法将ACKTR算法与基于预录专家轨迹的监督学习的单一专家模仿损失项相结合。
- 关键创新在于使用单一公式(公式1)将专家数据整合进策略梯度更新,引导探索而不累积误差。
- 专家损失应用于专家数据的小批量,通过超参数λ_expert控制其对策略更新的影响。
- 通过Kronecker-分解自然梯度优化的信赖域方法提升训练稳定性和收敛性。
- 在Montezuma’s Revenge和ViZDoom的MyWayHome上评估该方法,使用固定的专家演示且不采用课程学习。
- 通过调整超参数如γ = 0.995和λ_expert = 0.125、0.25或0.5以优化性能。
实验结果
研究问题
- RQ1专家增强的演员-critic学习是否能在稀疏奖励环境中实现优于专家演示的性能?
- RQ2将专家数据与ACKTR结合是否能提升Montezuma’s Revenge等环境中的样本效率与探索能力?
- RQ3该方法是否能在无课程学习或额外辅助奖励的情况下,学会在ViZDoom的MyWayHome迷宫中有效导航?
- RQ4在λ_expert和γ方面,专家损失与策略梯度损失之间的最优平衡是什么?
- RQ5该方法是否利用了未报告的环境错误?能否实现超越专家轨迹的性能?
主要发现
- 在Montezuma’s Revenge上,专家增强的演员-critic方法实现了27,052的平均得分,最佳运行达到804,900分,超过专家轨迹的评估占比达86%。
- 在某些轨迹中,智能体利用了Montezuma’s Revenge中未报告的漏洞,最高得分达到804,900分。
- 该方法优于行为克隆,后者尽管使用了近乎完美的专家演示,但仅获得575分。
- 在ViZDoom的MyWayHome迷宫中,专家增强方法在500万次动作内达到强劲性能,而无课程学习的模型无关ACKTR基线则失败。
- 最佳超参数为γ = 0.995和λ_expert = 0.125,当λ_expert过高或过低时性能显著下降。
- 在使用中位数策略时,该方法在16%的情况下优于专家数据本身;在最佳策略下,该比例达到86%。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。