[论文解读] Logarithmic Regret for Reinforcement Learning with Linear Function Approximation
该论文通过利用正的次优性间隙,在两种线性MDP假设——线性MDP和线性混合MDP——下,首次建立了强化学习中线性函数逼近的对数 regret 边界。在线性MDP假设下,LSVI-UCB 达到了 $\widetilde{O}(d^3H^5/\text{gap}_{\text{min}} \cdot \log T)$ 的 regret,而在线性混合MDP假设下,UCRL-VTR 达到了 $\widetilde{O}(d^2H^5/\text{gap}_{\text{min}} \cdot \log^3 T)$ 的 regret,显著优于先前的 $\sqrt{T}$ 类型边界。
Reinforcement learning (RL) with linear function approximation has received increasing attention recently. However, existing work has focused on obtaining $\sqrt{T}$-type regret bound, where $T$ is the number of interactions with the MDP. In this paper, we show that logarithmic regret is attainable under two recently proposed linear MDP assumptions provided that there exists a positive sub-optimality gap for the optimal action-value function. More specifically, under the linear MDP assumption (Jin et al. 2019), the LSVI-UCB algorithm can achieve $ ilde{O}(d^{3}H^5/ ext{gap}_{ ext{min}}\cdot \log(T))$ regret; and under the linear mixture MDP assumption (Ayoub et al. 2020), the UCRL-VTR algorithm can achieve $ ilde{O}(d^{2}H^5/ ext{gap}_{ ext{min}}\cdot \log^3(T))$ regret, where $d$ is the dimension of feature mapping, $H$ is the length of episode, $ ext{gap}_{ ext{min}}$ is the minimal sub-optimality gap, and $ ilde O$ hides all logarithmic terms except $\log(T)$. To the best of our knowledge, these are the first logarithmic regret bounds for RL with linear function approximation. We also establish gap-dependent lower bounds for the two linear MDP models.
研究动机与目标
- 弥合标准 $\sqrt{T}$ regret 边界与线性函数逼近强化学习中更紧致的实例相关边界之间的差距。
- 探究在存在正的次优性间隙时,近期线性MDP假设下是否可实现对数 regret。
- 在线性MDP和线性混合MDP设置中,建立 regret 的上下界,考虑问题相关的结构。
- 为无模型和有模型的强化学习算法提供首次基于间隙的 regret 分析,适用于线性函数逼近。
提出的方法
- 提出一种针对强化学习中线性函数逼近的依赖间隙分析框架,重点关注最小次优性间隙 $\text{gap}_{\text{min}}$。
- 在线性MDP假设下应用 LSVI-UCB 算法,推导出 $\widetilde{O}(d^3H^5/\text{gap}_{\text{min}} \cdot \log T)$ 的 regret 边界。
- 在线性混合MDP假设下应用 UCRL-VTR 算法,实现 $\widetilde{O}(d^2H^5/\text{gap}_{\text{min}} \cdot \log^3 T)$ 的 regret。
- 使用集中不等式,包括 Azuma–Hoeffding 和 Freedman,以控制值函数估计中鞅差分的波动。
- 基于次优性间隙区间对 regret 进行递归分解,以界定向各轮次累积误差。
- 推导出线性MDP和线性混合MDP模型的下界 $\Omega(dH/\text{gap}_{\text{min}})$,表明上界具有近似紧致性。
实验结果
研究问题
- RQ1在满足线性MDP假设的强化学习中,是否可实现对数 regret?
- RQ2在更一般的线性混合MDP假设下,是否可实现相同的对数 regret 缩放?
- RQ3最小次优性间隙 $\text{gap}_{\text{min}}$ 如何影响线性函数逼近强化学习中的 regret?
- RQ4在线性MDP和线性混合MDP设置中,regret 的实例相关下界是什么?
- RQ5与现有 $\sqrt{T}$ 类型的 regret 边界相比,所提边界的 $T$ 依赖性如何?
主要发现
- LSVI-UCB 在线性MDP假设下实现了 $\widetilde{O}(d^3H^5/\text{gap}_{\text{min}} \cdot \log T)$ 的 regret,标志着无模型强化学习中线性函数逼近首次实现对数 regret 边界。
- UCRL-VTR 在线性混合MDP假设下实现了 $\widetilde{O}(d^2H^5/\text{gap}_{\text{min}} \cdot \log^3 T)$ 的 regret,是首个实现有模型强化学习中线性函数逼近对数 regret 的结果。
- 该论文为线性MDP和线性混合MDP模型建立了 $\Omega(dH/\text{gap}_{\text{min}})$ 的依赖间隙下界,表明上界具有近乎紧致性。
- 结果表明,当次优性间隙远离零时,regret 中对 $T$ 的依赖可从 $\sqrt{T}$ 降低至 $\log T$。
- 分析揭示,维度 $d$、时域 $H$ 和最小间隙 $\text{gap}_{\text{min}}$ 是决定 regret 的关键因素,其中 $\text{gap}_{\text{min}}$ 在实现对数缩放中起核心作用。
- 所推导的边界为实例相关边界,显著优于先前的 $\sqrt{T}$ 类型边界,尤其在最优与次优动作之间差距较大的问题中表现更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。