[论文解读] Learning to Control in Metric Space with Optimal Regret
该论文提出了一种针对具有任意状态空间和动作空间(配备度量)的有限-horizon确定性控制系统的简单置信上界强化学习算法。通过使用函数逼近预言机,基于最近邻构造来估计乐观Q函数,该方法实现了 $ O(HL(KH)^{(d-1)/d}) $ 的遗憾,其中 $ d $ 为状态-动作空间的加倍维数,并在度量连续性假设下建立了近乎匹配的下界,证明了在该条件下的最优性。
We study online reinforcement learning for finite-horizon deterministic control systems with {\it arbitrary} state and action spaces. Suppose that the transition dynamics and reward function is unknown, but the state and action space is endowed with a metric that characterizes the proximity between different states and actions. We provide a surprisingly simple upper-confidence reinforcement learning algorithm that uses a function approximation oracle to estimate optimistic Q functions from experiences. We show that the regret of the algorithm after $K$ episodes is $O(HL(KH)^{\frac{d-1}{d}}) $ where $L$ is a smoothness parameter, and $d$ is the doubling dimension of the state-action space with respect to the given metric. We also establish a near-matching regret lower bound. The proposed method can be adapted to work for more structured transition systems, including the finite-state case and the case where value functions are linear combinations of features, where the method also achieve the optimal regret.
研究动机与目标
- 开发一种适用于确定性控制系统的一般在线强化学习算法,无需参数假设。
- 利用状态-动作空间上的度量结构,以实现从有限经验中有效泛化。
- 实现与内在维度(加倍维数)相关、而非与环境维度相关的次线性遗憾。
- 在度量连续性假设下,建立紧致的遗憾上界与下界。
- 将该方法适配至结构化情形,如有限状态MDP和线性函数逼近,每种情形下均实现最优遗憾。
提出的方法
- 该算法使用经验缓冲区存储过去的经验转移,并在每轮后利用函数逼近预言机重新计算乐观Q函数。
- 预言机通过将最近邻估计器拟合到观测数据,构建上置信度Q函数,确保在未见区域的乐观性。
- 该方法假设转移函数和奖励函数关于状态-动作空间上的给定度量是Lipschitz连续的。
- 遗憾通过信息论方法进行分析,将性能与度量空间的加倍维数联系起来。
- 对于线性模型,函数逼近器被调整为使用线性回归并上界估计未见特征,以确保遗憾有界。
- 该算法基于乐观Q函数动态更新策略,促进对高不确定性区域的探索。
实验结果
研究问题
- RQ1一种简单、基于度量的强化学习算法是否能在不假设动力学或奖励函数参数形式的前提下实现次线性遗憾?
- RQ2在度量连续性假设下,遗憾如何随状态-动作空间的内在维度(加倍维数)变化?
- RQ3所提出的遗憾上界是否最优?能否建立匹配的下界?
- RQ4该方法能否适配至结构化模型(如有限状态MDP和线性函数逼近)并实现最优性能?
- RQ5函数逼近预言机在度量空间中实现乐观性和泛化的过程中起到何种作用?
主要发现
- 该算法实现了 $ O(HL(KH)^{(d-1)/d}) $ 的遗憾上界,其中 $ d $ 为状态-动作空间的加倍维数,$ L $ 为平滑性参数,$ H $ 为时域长度。
- 建立了近乎匹配的遗憾下界 $ ilde{ heta}( ext{min}(| ext{covering set}|, K) imes H ) $,证明了上界在对数因子范围内最优。
- 在有限状态-动作情形下,遗憾简化为 $ O(SAH) $,与已知结果一致,验证了该方法作为表格型强化学习的推广。
- 对于具有 $ d $ 维特征的线性MDP,遗憾为 $ O(Hd) $,与当前最先进结果一致且为最优。
- 即使将函数逼近器替换为线性模型或其他结构化类别,该方法仍保持最优遗憾缩放。
- 基于最近邻的乐观函数逼近方法,可在连续度量空间中实现有效的泛化与探索。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。