[论文解读] Adaptive Reward-Free Exploration
该论文提出 RF-UCRL,一种自适应的无奖励探索算法,通过直接最小化最大 MDP 估计误差来提高样本效率。其样本复杂度达到 $({SAH^{4}}/{\varepsilon^{2}})(\log(1/\delta)+S)$ 量级,可在概率 $1-\delta$ 下找到 $\varepsilon$-最优策略,优于以往方法在小 $\varepsilon$ 和小 $\delta$ 的情形。
Reward-free exploration is a reinforcement learning setting studied by Jin et al. (2020), who address it by running several algorithms with regret guarantees in parallel. In our work, we instead give a more natural adaptive approach for reward-free exploration which directly reduces upper bounds on the maximum MDP estimation error. We show that, interestingly, our reward-free UCRL algorithm can be seen as a variant of an algorithm of Fiechter from 1994, originally proposed for a different objective that we call best-policy identification. We prove that RF-UCRL needs of order $({SAH^4}/{\varepsilon^2})(\log(1/δ) + S)$ episodes to output, with probability $1-δ$, an $\varepsilon$-approximation of the optimal policy for any reward function. This bound improves over existing sample-complexity bounds in both the small $\varepsilon$ and the small $δ$ regimes. We further investigate the relative complexities of reward-free exploration and best-policy identification.
研究动机与目标
- 开发一种更自然且自适应的无奖励探索方法,避免需要并行运行多个算法。
- 通过自适应探索减少最大 MDP 估计误差的上界。
- 为在任意奖励函数下实现 $\varepsilon$-最优性建立更紧致的样本复杂度边界。
- 阐明无奖励探索与最优策略识别之间的关系。
提出的方法
- 将 Fiechter 于 1994 年提出的原始用于最优策略识别的算法变体化为 RF-UCRL,重新用于无奖励探索。
- 使用上界置信区间(UCB)在无奖励情况下平衡探索与估计精度。
- 自适应调整探索策略,动态减少 MDP 模型中的不确定性,聚焦于对最优策略识别至关重要的状态和动作。
- 采用基于置信区间的策略,确保 MDP 估计精度的高概率保证。
- 基于置信区间设计终止条件,当找到 $\varepsilon$-最优策略时停止。
- 利用 MDP 的结构和时域 $H$,推导出估计误差和样本复杂度的紧致边界。
实验结果
研究问题
- RQ1单一自适应算法能否在无奖励探索中实现优于并行运行多个最小遗憾算法的样本复杂度?
- RQ2无奖励探索的样本复杂度与最优策略识别相比如何?
- RQ3在缺乏奖励信号的情况下,探索与估计误差之间的最优权衡是什么?
- RQ4与先前工作相比,RF-UCRL 算法能否在 $\varepsilon$ 和 $\delta$ 上实现改进的依赖关系以达到 $\varepsilon$-最优性?
主要发现
- RF-UCRL 实现了 $({SAH^{4}}/{\varepsilon^{2}})(\log(1/\delta)+S)$ 量级的样本复杂度,可在概率 $1-\delta$ 下输出 $\varepsilon$-最优策略。
- 该边界在小 $\varepsilon$ 和小 $\delta$ 的情形下优于现有方法。
- RF-UCRL 被证明是 Fiechter 1994 年最优策略识别算法的一种变体,揭示了无奖励探索与策略识别之间更深层次的联系。
- 该算法的自适应设计直接降低了最大 MDP 估计误差的上界,从而获得更紧致的理论保证。
- 分析结果证实,尽管目标不同,无奖励探索与最优策略识别具有相似的基本复杂度。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。