[论文解读] Sample Complexity of Robust Reinforcement Learning with a Generative Model
本文提出了一种基于模型的强化学习算法——鲁棒经验值迭代(REVI),当名义模型未知但拥有生成模型时,用于学习 $\varepsilon$-最优鲁棒策略。该文为三种不确定性集(总变差、卡方、KL散度)建立了有限样本保证,提供了精确的样本复杂度边界,并在仿真到现实迁移场景中展示了鲁棒策略相较于非鲁棒策略的理论优势。
The Robust Markov Decision Process (RMDP) framework focuses on designing control policies that are robust against the parameter uncertainties due to the mismatches between the simulator model and real-world settings. An RMDP problem is typically formulated as a max-min problem, where the objective is to find the policy that maximizes the value function for the worst possible model that lies in an uncertainty set around a nominal model. The standard robust dynamic programming approach requires the knowledge of the nominal model for computing the optimal robust policy. In this work, we propose a model-based reinforcement learning (RL) algorithm for learning an $ε$-optimal robust policy when the nominal model is unknown. We consider three different forms of uncertainty sets, characterized by the total variation distance, chi-square divergence, and KL divergence. For each of these uncertainty sets, we give a precise characterization of the sample complexity of our proposed algorithm. In addition to the sample complexity results, we also present a formal analytical argument on the benefit of using robust policies. Finally, we demonstrate the performance of our algorithm on two benchmark problems.
研究动机与目标
- 解决在名义模拟器模型未知但拥有生成模型时,学习鲁棒策略的强化学习挑战。
- 为基于总变差、卡方和 KL 散度定义的不确定性集下的鲁棒强化学习,提供非渐近、有限样本的性能保证(样本复杂度)。
- 在由于模型失配导致的仿真到现实差距场景下,正式证明鲁棒策略相较于非鲁棒策略的优势。
- 表征所提算法的样本复杂度相对于非鲁棒强化学习设置的特性,揭示鲁棒性对数据效率的影响。
提出的方法
- 提出鲁棒经验值迭代(REVI)算法,一种基于模型的强化学习方法,利用生成模型的样本学习 $\varepsilon$-最优鲁棒策略。
- 使用覆盖数方法的统一集中界来处理鲁棒动态规划中的非线性和偏差,从而实现有限样本分析。
- 针对每种不确定性集(总变差、卡方、KL),通过分析经验估计值与真实鲁棒值之间的偏差,利用集中不等式推导样本复杂度边界。
- 利用鲁棒 MDP 理论中的对偶结果来计算最优鲁棒值函数,并与非鲁棒策略进行比较。
- 提出一种新颖的分析技术,以界住经验鲁棒值估计中的偏差,从而使得原本仅适用于无偏设定的集中不等式得以应用。
- 使用一个包含两个模型($P^o$ 和 $P'$)的确定性 MDP 例子,通过解析方法展示在模型失配下非鲁棒策略与鲁棒策略之间的性能差距。
实验结果
研究问题
- RQ1当名义模型未知但拥有生成模型时,学习 $\varepsilon$-最优鲁棒策略的样本复杂度是多少?
- RQ2在不同不确定性集(总变差、卡方、KL 散度)下,鲁棒强化学习的样本复杂度如何变化?
- RQ3当模拟器模型与真实世界系统存在差异时,使用鲁棒策略相较于非鲁棒策略的理论优势是什么?
- RQ4能否在基于模型的设置下,为鲁棒强化学习算法建立有限样本保证?
- RQ5在相同性能和置信度要求下,鲁棒强化学习的样本复杂度与非鲁棒强化学习相比如何?
主要发现
- 对于总变差不确定性集,REVI 的样本复杂度为 $\mathcal{O}\left(\frac{|\mathcal{S}|^{2}|\mathcal{A}|}{(1-\gamma)^{4}\varepsilon^{2}}\right)$,与非鲁棒强化学习的复杂度仅相差常数因子。
- 对于卡方不确定性集,样本复杂度为 $\mathcal{O}\left(\frac{c_{r}|\mathcal{S}|^{2}|\mathcal{A}|}{(1-\gamma)^{4}\varepsilon^{2}}\right)$,其中 $c_r$ 为鲁棒性参数。
- 对于 KL 不确定性集,样本复杂度为 $\mathcal{O}\left(\frac{|\mathcal{S}|^{2}|\mathcal{A}|\exp(1/(1-\gamma))}{c_{r}^{2}(1-\gamma)^{4}\varepsilon^{2}}\right)$,显示出对折扣因子倒数的指数依赖。
- 本文正式证明了当真实世界模型与模拟器不一致时,鲁棒策略可实现显著优于非鲁棒策略的最坏情况性能,性能差距的下界为 $\frac{\gamma}{198(1-\gamma)}$。
- 所提算法在有限样本数下以高概率($1-\delta$)实现 $\varepsilon$-最优性,其中 $k$ 和 $N$ 的边界依赖于 $\varepsilon$、$\gamma$、$c_r$ 和 $\delta$。
- 分析表明,即使经验估计存在偏差,通过利用统一集中界和覆盖数方法,鲁棒强化学习在有限样本下仍具有可证明的可行性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。