[论文解读] Particle Value Functions
本文提出了粒子价值函数(PVF),一种基于粒子滤波近似指数效用价值函数的风险敏感强化学习目标,可在高方差环境中实现更稳定的策略梯度训练。在Cliffworld环境中,当β=1.0且K=3个粒子时,PVF能够偶尔解决任务,而标准REINFORCE和VIMCO方法则失败,表明其在探索罕见高回报轨迹方面具有优势。
The policy gradients of the expected return objective can react slowly to rare rewards. Yet, in some cases agents may wish to emphasize the low or high returns regardless of their probability. Borrowing from the economics and control literature, we review the risk-sensitive value function that arises from an exponential utility and illustrate its effects on an example. This risk-sensitive value function is not always applicable to reinforcement learning problems, so we introduce the particle value function defined by a particle filter over the distributions of an agent's experience, which bounds the risk-sensitive one. We illustrate the benefit of the policy gradients of this objective in Cliffworld.
研究动机与目标
- 为解决在罕见高回报轨迹至关重要的情况下,策略梯度在期望回报上的收敛缓慢问题。
- 开发一种可扩展且数值稳定的替代方法,用于基于指数效用的风险敏感价值函数,以应对实际中可能不稳定或高方差的问题。
- 使强化学习智能体能够根据风险偏好,强调低回报或高回报结果,即使这些结果出现概率极低。
- 设计一种方法,在无限样本极限下逼近风险敏感价值函数的同时保持其有界性,适用于大规模强化学习与非线性函数逼近。
提出的方法
- 提出粒子价值函数(PVF),通过K个代表状态-动作轨迹的粒子来近似风险敏感价值函数。
- 将PVF定义为K个独立蒙特卡洛轨迹的有限和,其值计算为总回报指数期望的对数再乘以-1/β。
- 使用自举粒子滤波器表示回报分布,从而在无需完整分布推断的情况下高效估计风险敏感目标。
- 对PVF目标应用策略梯度方法,并使用控制变量子孙减少方差,与REINFORCE和VIMCO基线进行比较。
- 引入随时间变化的策略参数化方法,以建模有限horizon任务。
- 针对β=0采用修改后的REINFORCE估计器,针对β≠0采用VIMCO风格的控制变量子孙,并为每种情况分别设置基线函数。
实验结果
研究问题
- RQ1能否通过强调罕见高回报轨迹的风险敏感价值函数,改善在高回报方差环境中的策略梯度收敛性?
- RQ2在大规模强化学习与非线性函数逼近中,基于指数效用的风险敏感价值函数如何实现可靠近似?
- RQ3基于粒子的风向价值函数近似方法是否在求解稀疏奖励任务方面优于VIMCO和REINFORCE等现有方法?
- RQ4风险偏好(β)和粒子数量(K)对策略梯度发现高回报、低概率轨迹的能力有何影响?
主要发现
- 在Cliffworld环境中,当β=1.0且K=3个粒子时,PVF能够偶尔解决任务,而使用相同设置的REINFORCE和VIMCO则完全无法解决该任务。
- 在β=1.0且K=3的条件下,PVF在部分运行中成功解决Cliffworld,而VIMCO未能成功,表明PVF在探索罕见高回报路径方面具有优势。
- 随着β的增加,Cliffworld中全局最优解的吸引域扩大,表明风险偏好行为可提升在非凸奖励景观中的收敛性能。
- 一旦VIMCO能够解决任务,其表现比PVF更可靠,但在相同条件(K=3,β=1.0)下,PVF在VIMCO失败时仍能成功,凸显其优越性。
- 在期望回报上使用标准REINFORCE算法的Cliffworld变体从未成功解决,凸显了风险中性目标在稀疏奖励设置中的局限性。
- PVF目标在数值上稳定,适用于大规模强化学习,因其避免了直接估计指数效用时的不稳定性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。