[论文解读] On the Use of Non-Stationary Policies for Stationary Infinite-Horizon Markov Decision Processes
本文提出了近似值迭代(AVI)和策略迭代(API)的新变体,针对无限时域折扣马尔可夫决策过程生成非时齐策略,性能界为 $\frac{2\gamma}{1-\gamma}\epsilon$,相比标准时齐策略的 $\frac{2\gamma}{(1-\gamma)^2}\epsilon$ 性能界,提升了 $\frac{1}{1-\gamma}$ 倍。关键洞见在于,当 $\gamma$ 接近 1 时,计算近似最优的非时齐策略远比计算近似最优的时齐策略简单。
We consider infinite-horizon stationary $γ$-discounted Markov Decision Processes, for which it is known that there exists a stationary optimal policy. Using Value and Policy Iteration with some error $ε$ at each iteration, it is well-known that one can compute stationary policies that are $\frac{2γ}{(1-γ)^2}ε$-optimal. After arguing that this guarantee is tight, we develop variations of Value and Policy Iteration for computing non-stationary policies that can be up to $\frac{2γ}{1-γ}ε$-optimal, which constitutes a significant improvement in the usual situation when $γ$ is close to 1. Surprisingly, this shows that the problem of "computing near-optimal non-stationary policies" is much simpler than that of "computing near-optimal stationary policies".
研究动机与目标
- 解决现有 AVI 和 API 算法在误差有界于 $\epsilon$ 时生成时齐策略且性能界为 $\frac{2\gamma}{(1-\gamma)^2}\epsilon$ 的局限性。
- 探究在相同误差假设下,非时齐策略是否能显著优于时齐策略获得更优的性能保证。
- 开发新的 AVI 和 API 变体,生成具有改进理论性能边界的周期性非时齐策略。
- 证明在存在近似误差时,计算近似最优非时齐策略的问题在本质上比计算近似最优时齐策略更简单。
提出的方法
- 提出一种改进的 AVI 算法,构建具有有界误差 $\epsilon_k$ 的值函数序列,并从最终策略序列中推导出非时齐策略。
- 引入两种新的策略迭代变体,通过在有限个时齐策略序列中循环,生成周期性非时齐策略。
- 定义一个周期性非时齐策略 $\pi_{k,m}$,其在迭代序列中最后 $m$ 个策略间循环,周期为 $m$。
- 利用贝尔曼算子和误差传播,结合 $T_{\pi_*}$ 的压缩性质,建立 $\|v_* - v_{\pi_{k,m}}\|_\infty$ 的递归误差界。
- 推导出非时齐策略的性能界为 $\frac{2\gamma}{(1-\gamma^m)(1-\gamma)}\epsilon$,当 $m \to \infty$ 时收敛至 $\frac{2\gamma}{1-\gamma}\epsilon$。
- 通过分量分析和数学归纳法证明误差界,表明当 $\gamma$ 接近 1 时,新界严格优于经典界 $\frac{2\gamma}{(1-\gamma)^2}\epsilon$。
实验结果
研究问题
- RQ1在无限时域 MDP 的近似 AVI 和 API 中,非时齐策略能否实现优于时齐策略的性能界?
- RQ2经典性能界 $\frac{2\gamma}{(1-\gamma)^2}\epsilon$ 对 AVI 和 API 是否都是紧的,即使在存在近似误差时?
- RQ3在相同误差模型下,计算近似最优非时齐策略的问题是否在本质上比计算近似最优时齐策略更简单?
- RQ4通过改进的 AVI 和 API 算法生成的非时齐策略,理论上可达到的性能界是什么?
- RQ5周期性非时齐策略中周期 $m$ 的选择如何影响近似误差与存储成本之间的权衡?
主要发现
- AVI 和 API 的经典性能界 $\frac{2\gamma}{(1-\gamma)^2}\epsilon$ 是紧的,即使对 AVI 而言,此前文献中尚未正式确立此结论。
- 所提出的基于 AVI 的非时齐策略算法实现了 $\frac{2\gamma}{(1-\gamma^m)(1-\gamma)}\epsilon$ 的性能界,相比标准界提升了 $\frac{1}{1-\gamma}$ 倍。
- 对于周期为 $m$ 的周期性非时齐策略,当 $m \to \infty$ 时,性能界收敛至 $\frac{2\gamma}{1-\gamma}\epsilon$,当 $\gamma$ 接近 1 时显著优于原界。
- 通过选择 $m = \left\lceil \frac{1}{1-\gamma} \right\rceil$,性能界最多为 $\frac{3.164\gamma}{1-\gamma}\epsilon$,与渐近界处于常数因子范围内。
- 新界 $\frac{2\gamma}{1-\gamma}\epsilon$ 被猜想为紧界,作者认为分析可推广至 $L_p$-范数误差控制。
- 结果表明,在相同误差模型下,计算近似最优非时齐策略在本质上比计算近似最优时齐策略更简单。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。