Skip to main content
QUICK REVIEW

[论文解读] A Variant of the Wang-Foster-Kakade Lower Bound for the Discounted Setting

Philip Amortila, Nan Jiang|arXiv (Cornell University)|Nov 2, 2020
Reinforcement Learning in Robotics参考文献 1被引用 9
一句话总结

本文提出一个简化的两状态、一维特征的马尔可夫决策过程(MDP),在折扣设置下展示了即使具有线性可实现的价值函数和良好的特征覆盖,批量强化学习仍可能具有无限样本复杂度。该构造表明,由于未观测到的状态-动作对,即使在无限数据下学习最优策略在本质上也是不可能的,从而挑战了批量强化学习中的传统假设。

ABSTRACT

Recently, Wang et al. (2020) showed a highly intriguing hardness result for batch reinforcement learning (RL) with linearly realizable value function and good feature coverage in the finite-horizon case. In this note we show that once adapted to the discounted setting, the construction can be simplified to a 2-state MDP with 1-dimensional features, such that learning is impossible even with an infinite amount of data.

研究动机与目标

  • 证明在折扣设置下,即使具有线性可实现的价值函数,批量强化学习仍可能具有无限样本复杂度。
  • 将Wang等人(2020)的有限horizon下界构造简化为一个最小化的两状态、一维特征MDP,以适用于折扣情形。
  • 表明在折扣设置下,良好的特征覆盖性和价值函数可实现性并不能保证批量强化学习的可学习性。
  • 挑战传统观点,即有限horizon与折扣强化学习设置在结构上是相似的。

提出的方法

  • 构建一个确定性MDP,包含两个状态:s_A以0奖励转移到s_B,s_B具有自环并获得奖励r。
  • 定义一个一维特征映射,满足φ(s_A) = γ,φ(s_B) = 1,从而确保价值函数的线性可实现性。
  • 使用仅从s_A采样转移的批量数据分布,因此s_B从未被观测到。
  • 证明在数据分布下,特征协方差矩阵的特征值为γ² > 0,满足覆盖性假设。
  • 表明学习者无法识别真实奖励r,即使在无限数据下也无法估计Q值。
  • 将构造推广至d维特征及具有多个动作的控制设置,以推广结果。

实验结果

研究问题

  • RQ1能否通过一个最小化的MDP构造,在折扣设置下展示批量强化学习的无限样本复杂度?
  • RQ2即使具备线性可实现性和良好的特征覆盖,折扣设置下是否仍无法保证可学习性?
  • RQ3Wang等人(2020)的有限horizon下界构造能否在折扣情形下被简化,同时不损失困难性结果?
  • RQ4尽管结构上相似,有限horizon与折扣设置是否表现出根本不同的学习复杂度?
  • RQ5该下界能否扩展至具有多个动作的控制MDP,同时保持学习不可能性?

主要发现

  • 所构造的两状态MDP,配合同维特征和任意折扣因子γ ∈ (0,1),在批量强化学习中表现出无限样本复杂度。
  • 尽管价值函数具有线性可实现性,且特征协方差矩阵的特征值为γ² > 0,真实奖励r仍无法从数据中识别。
  • 由于缺乏对s_B的观测,学习者即使在无限数据下也无法确定s_A或s_B的值。
  • 该下界可扩展至d维特征,其中特征覆盖性为Θ(1/d),但误差仍保持为Ω(1)。
  • 在具有两个动作的控制设置中,最优Q值可与真实值任意远离,导致策略学习不可能。
  • 该结果挑战了有限horizon与折扣强化学习设置可互换的假设,表明二者在学习复杂度上存在根本差异。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。