[论文解读] Stochastic Approximation for Risk-aware Markov Decision Processes
本文提出了一种用于求解无限时域风险感知马尔可夫决策过程(MDPs)的两重循环随机逼近算法,结合Q-learning与鞍点子程序以计算风险度量。该算法建立了几乎必然收敛性,并在概率至少为 $1-\delta$ 的条件下,给出了收敛速率 $\Omega\left((\ln(1/\delta\epsilon)/\epsilon^{2})^{1/k}+(\ln(1/\epsilon))^{1/(1-k)}\right)$,覆盖了广泛使用风险度量,如CVaR和优化确定等价物(OCE)。
We develop a stochastic approximation-type algorithm to solve finite state/action, infinite-horizon, risk-aware Markov decision processes. Our algorithm has two loops. The inner loop computes the risk by solving a stochastic saddle-point problem. The outer loop performs $Q$-learning to compute an optimal risk-aware policy. Several widely investigated risk measures (e.g. conditional value-at-risk, optimized certainty equivalent, and absolute semi-deviation) are covered by our algorithm. Almost sure convergence and the convergence rate of the algorithm are established. For an error tolerance $ε>0$ for the optimal $Q$-value estimation gap and learning rate $k\in(1/2,\,1]$, the overall convergence rate of our algorithm is $Ω((\ln(1/δε)/ε^{2})^{1/k}+(\ln(1/ε))^{1/(1-k)})$ with probability at least $1-δ$.
研究动机与目标
- 当真实转移动态和代价函数未知时,开发一种无需模型的强化学习算法,用于风险感知MDPs。
- 将随机逼近与Q-learning相结合,仅通过观测轨迹计算风险感知策略。
- 支持广泛的風險度量,包括条件风险价值(CVaR)、优化确定等价物(OCE)和绝对半偏差。
- 建立几乎必然收敛性,并推导所提算法的有限样本收敛速率。
- 提供一个统一框架,将风险评估与策略优化整合于单一、可扩展的学习过程中。
提出的方法
- 该算法采用两重循环结构:内层循环求解一个随机鞍点问题以估计风险度量,外层循环执行Q-learning以优化风险感知策略。
- 通过一致风险度量的对偶表示进行风险评估,从而能够使用随机逼近方法进行估计。
- 该算法采用学习率 $k \in (1/2, 1]$,并基于采样轨迹使用递归更新来估计Q值函数。
- 采用具有可控噪声和鞅差序列的随机逼近框架,以确保收敛性。
- 收敛性分析依赖于使用代数不等式和李雅普诺夫型论证,对风险估计误差和Q值更新误差进行有界控制。
- 该方法具有足够的通用性,可通过其共轭凸表示处理任意分布不变、一致的风险度量,包括CVaR和OCE。
实验结果
研究问题
- RQ1能否设计一种基于随机逼近的算法,在无模型设定下求解无限时域风险感知MDPs?
- RQ2如何高效估计并整合CVaR和OCE等风险度量至Q-learning框架中?
- RQ3在一般条件下,此类风险感知Q-learning算法的收敛速率是多少?
- RQ4该算法能否在保持广泛风险度量类别的有限样本速率的同时,实现几乎必然收敛?
- RQ5学习率 $k$ 如何影响收敛速度与误差容限之间的权衡?
主要发现
- 在温和的正则性条件下,该算法几乎必然收敛至最优风险感知Q值函数。
- 对于误差容限 $\epsilon > 0$ 和学习率 $k \in (1/2, 1]$,收敛速率为 $\Omega\left((\ln(1/\delta\epsilon)/\epsilon^{2})^{1/k} + (\ln(1/\epsilon))^{1/(1-k)}\right)$,概率至少为 $1 - \delta$。
- 该方法可通过其共轭凸表示支持广泛的風險度量,包括条件风险价值(CVaR)、优化确定等价物(OCE)和绝对半偏差。
- 收敛速率通过一种新颖的递归随机更新分析推导得出,结合了风险估计误差与Q值更新误差的界。
- 对于线性学习率情形($k=1$),样本复杂度为 $N = \Omega\left(\frac{C_G + (\gamma f(t))^2}{\tilde{\varepsilon}}\right)$,以实现 $\mathbb{E}[\|Q_N - Q^*\|_2^2] \leq \tilde{\varepsilon}$。
- 分析表明,即使风险估计与策略更新步骤通过随机反馈耦合,该算法仍能保持稳定性和收敛性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。