[论文解读] Near-optimal Representation Learning for Linear Bandits and Linear RL
该论文提出 MTLR-OFUL,一种用于多任务线性 bandits 和具有线性函数逼近的周期性强化学习的样本高效算法,通过在任务间共享低维表示来实现。在线性 bandits 中,其遗憾界接近最优,为 $\tilde{O}(M\sqrt{dkT} + d\sqrt{kMT})$;在强化学习中,遗憾界为 $\tilde{O}(HM\sqrt{dkT} + Hd\sqrt{kMT} + HMT\sqrt{d}\mathcal{I})$,显著优于独立学习基线,并证明了紧致的下界。
This paper studies representation learning for multi-task linear bandits and multi-task episodic RL with linear value function approximation. We first consider the setting where we play $M$ linear bandits with dimension $d$ concurrently, and these bandits share a common $k$-dimensional linear representation so that $k\ll d$ and $k \ll M$. We propose a sample-efficient algorithm, MTLR-OFUL, which leverages the shared representation to achieve $ ilde{O}(M\sqrt{dkT} + d\sqrt{kMT} )$ regret, with $T$ being the number of total steps. Our regret significantly improves upon the baseline $ ilde{O}(Md\sqrt{T})$ achieved by solving each task independently. We further develop a lower bound that shows our regret is near-optimal when $d > M$. Furthermore, we extend the algorithm and analysis to multi-task episodic RL with linear value function approximation under low inherent Bellman error \citep{zanette2020learning}. To the best of our knowledge, this is the first theoretical result that characterizes the benefits of multi-task representation learning for exploration in RL with function approximation.
研究动机与目标
- 开发一种用于具有 $M$ 个任务间共享低维表示的多任务线性 bandits 的样本高效算法。
- 将该算法扩展至具有线性值函数逼近和低固有贝尔曼误差的多任务周期性强化学习。
- 从理论上建立表示学习在函数逼近的序列决策中促进探索的优势。
- 证明接近最优的遗憾界和下界,以验证所提算法的最优性。
提出的方法
- 提出 MTLR-OFUL,一种多任务线性 bandits 算法,通过正则化最小二乘估计器联合优化共享低维表示和任务特定参数。
- 采用类似 OFUL 的置信椭球方法,但针对共享表示学习进行了调整,并引入一种新颖的正则化方法,以促进任务间的低秩结构。
- 提出一种新颖的多任务周期性强化学习算法框架,利用共享的 $k$-维表示,并应用具有表示感知正则化的 LSVI 风格更新。
- 通过一种新颖的估计误差与表示误差的分解方式推导遗憾界,并仔细处理共享子空间结构。
- 通过从单任务设置构造困难实例的方式建立下界,证明遗憾界的紧致性。
- 通过将遗憾界以近似误差 $\zeta$ 的形式进行有界分析,评估模型误设下的鲁棒性。
实验结果
研究问题
- RQ1当任务共享一个共同的低维表示时,多任务表示学习是否能显著降低线性 bandits 中的遗憾?
- RQ2在共享 $k$-维表示的多任务线性 bandits 中,遗憾的根本极限是什么?所提算法是否接近最优?
- RQ3共享表示学习的优势能否扩展至具有线性函数逼近的多任务周期性强化学习?
- RQ4固有贝尔曼误差 $\mathcal{I}$ 如何影响具有共享表示的多任务强化学习的样本效率?
- RQ5所提算法对模型误设是否具有鲁棒性?近似误差 $\zeta$ 如何影响遗憾?
主要发现
- 所提 MTLR-OFUL 算法在多任务线性 bandits 中实现了 $\tilde{O}(M\sqrt{dkT} + d\sqrt{kMT})$ 的遗憾界,优于独立学习基线 $\tilde{O}(Md\sqrt{T})$。
- 该遗憾界接近最优,如在 $d > M$ 的情形下,匹配的下界为 $\Omega(Mk\sqrt{HT} + d\sqrt{HkMT})$,仅相差对数因子。
- 对于具有线性值函数逼近的多任务周期性强化学习,该算法实现了 $\tilde{O}(HM\sqrt{dkT} + Hd\sqrt{kMT} + HMT\sqrt{d}\mathcal{I})$ 的遗憾界,显著优于独立的 ELEANOR 基线。
- 当真实参数位于 $k$-维子空间 $\zeta$-误差范围内时,该算法对模型误设保持鲁棒,遗憾界为 $\tilde{O}(M\sqrt{dkT} + d\sqrt{kMT} + MT\sqrt{d}\zeta)$。
- 该论文首次建立了多任务线性强化学习中探索的可证明样本高效算法,其遗憾界与信息论下界紧密匹配。
- 理论分析证实,共享表示学习在具有函数逼近的线性 bandits 和周期性强化学习中均能实现显著的数据效率提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。