Skip to main content
QUICK REVIEW

[论文解读] QUOTA: The Quantile Option Architecture for Reinforcement Learning

Shangtong Zhang, Borislav Mavrin|arXiv (Cornell University)|Nov 5, 2018
Reinforcement Learning in Robotics被引用 4
一句话总结

QUOTA 提出了一种新颖的强化学习架构,该架构利用价值分布的分位数进行决策,通过乐观(高分位数)和悲观(低分位数)策略实现自适应探索。通过在分层框架中整合这些基于分位数的选项,QUOTA 在 Atari 游戏和 Roboschool 机器人模拟器中均提升了样本效率和性能,优于标准的 DDPG 和 QR-DDPG 基线模型。

ABSTRACT

In this paper, we propose the Quantile Option Architecture (QUOTA) for exploration based on recent advances in distributional reinforcement learning (RL). In QUOTA, decision making is based on quantiles of a value distribution, not only the mean. QUOTA provides a new dimension for exploration via making use of both optimism and pessimism of a value distribution. We demonstrate the performance advantage of QUOTA in both challenging video games and physical robot simulators.

研究动机与目标

  • 为解决基于均值的价值估计在强化学习中的局限性,该方法无法充分利用回报分布以实现高效探索。
  • 开发一种方法,通过价值分布的分位数动态选择乐观与悲观探索策略。
  • 将选项框架扩展至支持基于分位数的决策机制,适用于离散动作与连续动作问题。
  • 通过实证验证,基于分位数的探索可提升复杂环境中的样本效率与最终性能。

提出的方法

  • QUOTA 采用分布式强化学习方法,将状态-动作值表示为一组分位数,而非仅使用均值。
  • 动作选择基于价值分布的特定分位数,其中高分位数支持乐观探索,低分位数支持悲观探索。
  • 高层级选项策略在每一步选择使用哪个分位数,实现探索策略的动态切换。
  • 对于连续动作问题,QUOTA 引入多个分位数演员,每个演员专门用于最大化价值分布的特定分位数。
  • 该方法采用分位数回归损失训练价值网络,并使用带有经验回放和目标网络的改进 DDPG 算法。
  • 选项价值函数通过结合即时奖励与未来选项价值的自举目标进行训练,并引入终止概率以建模选项持续时间。

实验结果

研究问题

  • RQ1利用回报的完整分布(而非仅均值)是否能提升强化学习中的探索效率?
  • RQ2在不同环境中,使用高分位数(乐观)或低分位数(悲观)是否能带来更高的样本效率?
  • RQ3一种可动态选择基于分位数策略的分层选项框架,能否在多样化任务中自适应地提升性能?
  • RQ4与标准 DDPG 和 QR-DDPG 相比,QUOTA 在最终性能和学习稳定性方面表现如何?

主要发现

  • 在 49 个 Atari 游戏中,QUOTA 显著优于 QR-DDPG 和 DDPG,三轮独立运行的中位数得分分别为 2555.80、2364.60 和 1730.33。
  • 在 Roboschool 环境中,QUOTA 的平均回报高于 DDPG 和 QR-DDPG,评估曲线显示其收敛更快且最终性能更优。
  • 在 Montezuma’s Revenge 和 Private Eye 等探索尤为困难的任务中,QUOTA 展现出一致的性能提升。
  • QUOTA 能够在乐观与悲观策略间灵活切换,从而在均值方法难以高效探索的环境中实现更快的学习。
  • 在连续控制任务中使用分位数演员,实现了稳定训练并提升了样本效率,如 Roboschool 中的学习曲线所示。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。