QUICK REVIEW
[论文解读] Quantile Reinforcement Learning
Hugo Gilbert, Paul Weng|arXiv (Cornell University)|Nov 3, 2016
Auction Theory and Applications被引用 6
一句话总结
本文提出量化分位数Q-learning(Quantile Q-learning),一种利用双时间尺度随机逼近方法的算法,旨在学习针对分位数标准而非期望累积奖励优化的策略。该算法在《谁想成为百万富翁》模拟中成功实现了对结果第30百分位数的最大化,使策略和价值函数学习稳定收敛至目标分位数值0.7。
ABSTRACT
In reinforcement learning, the standard criterion to evaluate policies in a state is the expectation of (discounted) sum of rewards. However, this criterion may not always be suitable, we consider an alternative criterion based on the notion of quantiles. In the case of episodic reinforcement learning problems, we propose an algorithm based on stochastic approximation with two timescales. We evaluate our proposition on a simple model of the TV show, Who wants to be a millionaire.
研究动机与目标
- 为解决标准强化学习依赖于期望累积奖励的局限性,提出一种针对分位数性能标准进行优化的方法。
- 在仅能获得序数反馈或对极端结果具有鲁棒性要求的场景中实现学习。
- 开发一种强化学习算法,学习在特定分位数下最优的策略,而非针对回报分布的均值。
- 在具有偏态奖励分布的真实世界阶段决策环境中,通过实证方法验证该方法的有效性。
提出的方法
- 该方法采用双时间尺度随机逼近,其中Q函数在较快的时间尺度上更新,而分位数参数θ在较慢的时间尺度上更新。
- 算法使用改进的Q-learning更新规则,结合ε-greedy探索策略,并采用学习率α(n) = 1/(n+1)^1.1以满足收敛条件。
- 根据当前估计值V*θ(s₀)是否低于或高于目标分位数1−τ,基于步长1/n更新分位数参数θ。
- 通过调整θ使回报分布的分位数向期望百分位数(如τ=0.3对应第30百分位数)移动,从而隐式优化策略。
- 算法维护一个最终状态访问频率向量f,并通过f与奖励向量的叉积计算得分,以追踪策略性能。
- 收敛性由双时间尺度随机逼近理论框架(Borkar, 2008)保证,θ收敛至使V*θ(s₀) = 1−τ的值。
实验结果
研究问题
- RQ1强化学习能否被有效适配以优化回报分布的分位数而非期望值?
- RQ2如何利用双时间尺度随机逼近框架学习一种最大化特定累积奖励分位数的策略?
- RQ3所提出算法在具有偏态奖励分布的真实世界阶段决策任务中的实证性能如何?
- RQ4该算法如何收敛至目标分位数,θ参数在塑造回报分布中起到何种作用?
主要发现
- 该算法成功学习到一种最大化回报第30百分位数的策略,V*θ(s₀)在1000万次学习步骤后收敛至目标值0.7(即1−τ)。
- 表示策略实证性能的得分收敛至约0.7,但略低于目标值,原因在于探索效应。
- 参数θ收敛至稳定值4,该值对应于使V*θ(s₀) = 0.7的分位数参数。
- 随着学习进程推进,V*θ(s₀)在0.7附近呈现递减振荡,表明收敛稳定。
- 学习率α(n) = 1/(n+1)^1.1满足收敛所需条件,确保渐近稳定性。
- 该方法在具有偏态奖励分布的环境中表现出鲁棒性,例如《谁想成为百万富翁》这类场景中,最大化中位数或低分位数比最大化均值更具实际意义。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。