[论文解读] Nearly Minimax Optimal Reward-free Reinforcement Learning
该论文提出SSTP,一种新型无奖励强化学习算法,通过使样本复杂度随规划时域H对数缩放,实现近乎极小极大最优的样本复杂度,其与基本下限仅相差对数因子。该方法采用分阶段采样与软截断规划,可高效探索并为任意奖励函数进行规划,仅需极少数据,从而解决了无奖励强化学习中长期存在的上下界差距问题。
We study the reward-free reinforcement learning framework, which is particularly suitable for batch reinforcement learning and scenarios where one needs policies for multiple reward functions. This framework has two phases. In the exploration phase, the agent collects trajectories by interacting with the environment without using any reward signal. In the planning phase, the agent needs to return a near-optimal policy for arbitrary reward functions. We give a new efficient algorithm, extbf{S}taged extbf{S}ampling + extbf{T}runcated extbf{P}lanning (\algoname), which interacts with the environment at most $O\left( \frac{S^2A}{ε^2} ext{poly}\log\left(\frac{SAH}ε ight) ight)$ episodes in the exploration phase, and guarantees to output a near-optimal policy for arbitrary reward functions in the planning phase. Here, $S$ is the size of state space, $A$ is the size of action space, $H$ is the planning horizon, and $ε$ is the target accuracy relative to the total reward. Notably, our sample complexity scales only \emph{logarithmically} with $H$, in contrast to all existing results which scale \emph{polynomially} with $H$. Furthermore, this bound matches the minimax lower bound $Ω\left(\frac{S^2A}{ε^2} ight)$ up to logarithmic factors. Our results rely on three new techniques : 1) A new sufficient condition for the dataset to plan for an $ε$-suboptimal policy; 2) A new way to plan efficiently under the proposed condition using soft-truncated planning; 3) Constructing extended MDP to maximize the truncated accumulative rewards efficiently.
研究动机与目标
- 解决无奖励强化学习中现有上界与极小极大下界之间的根本差距,特别是规划时域H的多项式依赖问题。
- 设计一种算法,实现接近理论最小值的样本复杂度,与Ω(S²A/ε²)下界仅相差对数因子。
- 消除样本复杂度中对H的多项式依赖,该依赖长期阻碍了长时域环境中的可扩展性。
- 放宽对奖励函数均匀有界的假设,转而采用总体有界性,从而扩大在现实场景中的适用性。
- 提出一种新的理论框架,用于在截断值函数下判断数据集的充分性,并实现不确定性下的高效规划。
提出的方法
- 提出一种新的数据集充分性条件,用于支持ε-次优策略的规划,基于状态-动作访问覆盖度与置信区间。
- 设计一种软截断规划机制,优先选择高覆盖度的状态-动作对,同时通过截断奖励限制过估计。
- 构建一个扩展的MDP以最大化截断累积奖励,从而在不确定性下实现高效探索与规划。
- 采用分阶段采样与自适应阶段调度,每个阶段提高状态-动作对的最小访问阈值。
- 采用基于置信区间的探索策略,平衡覆盖度与估计精度,其边界基于Hoeffding型不等式推导。
- 利用值函数差异的递归分解,将次优性差距表示为访问加权置信区间的形式。
实验结果
研究问题
- RQ1是否可以使无奖励强化学习的样本复杂度在对数缩放之外完全独立于规划时域H?
- RQ2在放宽奖励函数假设的条件下,是否可能在无奖励强化学习中实现样本复杂度的极小极大最优?
- RQ3数据集需满足何种条件,才能确保对任意奖励函数均可规划出ε-最优策略?
- RQ4当数据集在无奖励信号下收集时,如何使规划在不确定性下仍保持高效与鲁棒?
- RQ5单一数据集是否可支持在多个、任意奖励函数下实现近似最优策略,且样本开销极小?
主要发现
- 所提出的SSTP算法在高概率下实现样本复杂度O((SA/ε²)(S + log(1/δ)) · polylog(SAH/ε)),与极小极大下界Ω(S²A/ε²)仅相差对数因子。
- 样本复杂度随规划时域H对数缩放,与先前工作(如H³或H⁵)的多项式缩放形成鲜明对比,实现了指数级改进。
- 该算法在探索后可保证对任意非负、总体有界于1的奖励函数,均能获得ε-最优策略,即使在数据收集过程中无奖励反馈。
- 该方法通过去除对均匀有界奖励的依赖,仅要求总体有界性,从而在实际中更具可行性,优于先前结果。
- 理论分析证实,该算法的次优性差距被限制在O(K²ε)以内,其中K为阶段数,且在所提出的置信区间框架下该界为紧致。
- 软截断规划机制可有效抑制值函数估计中的过估计,从而实现从单一数据集中稳定且高效地推导策略。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。