Skip to main content
QUICK REVIEW

[论文解读] Randomized Optimal Stopping Problem in Continuous time and Reinforcement Learning Algorithm

Yuchao Dong|arXiv (Cornell University)|Aug 4, 2022
Reinforcement Learning in Robotics被引用 4
一句话总结

本文通过在奖励函数中引入熵正则化,提出了一种连续时间下的随机最优停止框架,将问题转化为可解的HJB方程。该研究建立了策略迭代的收敛速率,并证明温度参数λ在学习速度与偏差之间起到平衡作用,数值结果验证了该方法在美式看跌期权上的有效性,采用定制的强化学习算法进行实现。

ABSTRACT

In this paper, we study the optimal stopping problem in the so-called exploratory framework, in which the agent takes actions randomly conditioning on current state and an entropy-regularized term is added to the reward functional. Such a transformation reduces the optimal stopping problem to a standard optimal control problem. We derive the related HJB equation and prove its solvability. Furthermore, we give a convergence rate of policy iteration and the comparison to classical optimal stopping problem. Based on the theoretical analysis, a reinforcement learning algorithm is designed and numerical results are demonstrated for several models.

研究动机与目标

  • 将强化学习的探索性框架扩展至连续时间最优停止问题。
  • 通过熵正则化,将最优停止问题重新表述为正则化的最优控制问题。
  • 推导并证明美式看跌期权相关汉密尔顿-雅可比-贝尔曼(HJB)方程的可解性。
  • 分析温度参数λ在收敛速率与偏差之间的权衡关系。
  • 基于理论洞察设计并验证一种强化学习算法,通过在金融模型上的数值实验进行验证。

提出的方法

  • 引入一种随机策略框架,其中动作根据价值估计的温度调节softmax函数以概率方式选择。
  • 通过添加与策略微分熵成比例的正则化项来修改奖励函数,以促进探索。
  • 推导该探索性公式下的值函数HJB方程,利用粘性解理论与Schauder估计证明其可解性。
  • 建立正则化值函数与经典最优值函数之间差值的界,表明其量级为O(λ log(1/λ))。
  • 设计具有收敛速率分析的策略迭代算法,证明在适当条件下具有线性收敛性。
  • 实现一种基于神经网络近似值函数与策略的强化学习算法,采用软停止规则以确保可微性。
Figure 1 : Value functions $u^{\lambda}$ and $u^{*}$ at $t=0$
Figure 1 : Value functions $u^{\lambda}$ and $u^{*}$ at $t=0$

实验结果

研究问题

  • RQ1如何将连续时间强化学习中的探索性框架适配至连续时间最优停止问题?
  • RQ2温度参数λ对解的收敛速度与偏差之间权衡的影响是什么?
  • RQ3为正则化最优停止问题推导出的HJB方程是否可证明存在经典解?
  • RQ4正则化值函数V^λ与经典最优值函数V*在近似误差方面有何关系?
  • RQ5在此随机最优停止设定下,策略迭代算法的收敛速率如何?

主要发现

  • 正则化最优停止问题的HJB方程被证明具有经典解,其连续可微性通过局部Schauder估计建立。
  • 正则化值函数V^λ与经典最优值函数V*之间的差异被界为O(λ log(1/λ)),表明偏差受控。
  • 策略迭代算法线性收敛,其收敛速率取决于温度参数λ的选择。
  • 数值结果表明,增大λ可提升收敛速度,但会增加解的偏差,验证了该权衡关系。
  • 所提出的强化学习算法成功学习了美式看跌期权的最优停止策略,软停止规则使得基于梯度的优化成为可能。
  • 预期贴现收益损失的理论界约为O(λ log(1/λ)),量化了使用随机策略所带来的财富成本。
(a) $\{u^{\lambda}>h\}$
(a) $\{u^{\lambda}>h\}$

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。