[论文解读] Optimistic Policy Optimization with Bandit Feedback
该论文提出了一种基于乐观策略优化的算法,用于在转移概率未知且仅提供bandit反馈的表格型有限horizon MDP中进行基于模型的强化学习。对于随机奖励,其遗憾度为 $×\tilde{O}(\sqrt{S^{2}AH^{4}K})$;对于对抗性奖励,其遗憾度为 $\tilde{O}(\sqrt{S^{2}AH^{4}}K^{2/3})$ —— 这是此类条件下策略优化首次实现次线性遗憾边界。
Policy optimization methods are one of the most widely used classes of Reinforcement Learning (RL) algorithms. Yet, so far, such methods have been mostly analyzed from an optimization perspective, without addressing the problem of exploration, or by making strong assumptions on the interaction with the environment. In this paper we consider model-based RL in the tabular finite-horizon MDP setting with unknown transitions and bandit feedback. For this setting, we propose an optimistic trust region policy optimization (TRPO) algorithm for which we establish $ ilde O(\sqrt{S^2 A H^4 K})$ regret for stochastic rewards. Furthermore, we prove $ ilde O( \sqrt{ S^2 A H^4 } K^{2/3} ) $ regret for adversarial rewards. Interestingly, this result matches previous bounds derived for the bandit feedback case, yet with known transitions. To the best of our knowledge, the two results are the first sub-linear regret bounds obtained for policy optimization algorithms with unknown transitions and bandit feedback.
研究动机与目标
- 解决在转移概率未知、仅提供bandit反馈的无模型强化学习设置下,策略优化缺乏理论遗憾保证的问题。
- 弥合策略优化算法与其在具有挑战性的探索设置下的理论性能之间的差距。
- 在不依赖于如单链MDP或集中度系数等限制性假设的前提下,建立随机与对抗性奖励设定下的次线性遗憾边界。
- 提出一种新颖的分析框架,将乐观性与bandit反馈在策略优化中结合,实现高效的探索。
提出的方法
- 提出一种乐观策略优化算法(POMD),通过维护价值函数的置信区间,并利用重要性采样处理bandit反馈。
- 基于镜像下降与Bregman散度,提出一种基于状态的闭式策略更新规则,实现高效优化。
- 在代价函数中引入奖励项以鼓励探索,该奖励项基于对转移模型和奖励估计的置信区间推导得出。
- 应用一种新颖的集中不等式,用于分析真实模型与估计模型之间访问频率的差异,利用了乐观规划的结构特性。
- 通过在所有状态和所有回合上使用联合界,建立真实与估计状态-动作访问频率差异的高概率上界。
- 通过将总遗憾分解为估计误差、优化误差和探索奖励项,并利用鞅集中不等式,推导出遗憾边界。
实验结果
研究问题
- RQ1在转移概率未知且仅提供bandit反馈的表格型MDP中,策略优化算法能否实现次线性遗憾?
- RQ2在相同的bandit反馈设置下,策略优化的性能与基于占用度量的方法相比如何?
- RQ3在bandit反馈下,遗憾度对回合数 $K$、状态空间大小 $S$、动作空间大小 $A$ 和horizon $H$ 的最优依赖关系是什么?
- RQ4在部分反馈下,能否有效结合不确定性下的乐观性与策略梯度风格的更新?
- RQ5当仅提供bandit反馈时,是否可能在遗憾边界上达到全信息设置下最先进的结果?
主要发现
- 所提出的POMD算法在随机奖励下实现了 $×\tilde{O}(\sqrt{S^{2}AH^{4}K})$ 的遗憾度,与全信息设置下已知的最佳边界一致。
- 在对抗性奖励下,算法实现了 $\tilde{O}(\sqrt{S^{2}AH^{4}}K^{2/3})$ 的遗憾度,与Neu等人(2010a)在全信息乐观策略优化中的上界一致。
- 这些遗憾边界是首次在转移概率未知且仅提供bandit反馈的策略优化中实现次线性结果,填补了关键的理论空白。
- 分析表明,价值函数中的乐观性与模型估计可有效结合到bandit反馈下的策略更新中。
- 算法对对抗性奖励序列具有鲁棒性,这体现在对抗情形下 $K^{2/3}$ 的依赖关系上。
- 该方法避免了对集中度系数或单链假设的依赖,而这些假设在实际中往往不可行或为无穷大。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。