[论文解读] On the Sample Complexity of Reinforcement Learning with Policy Space Generalization
本文引入了一种针对策略空间的新型弹射维数(eluder dimension)概念,用于刻画策略空间泛化下强化学习的内在复杂度。该文提出了一种基于堆栈的探索算法,其样本复杂度近似最优,且与弹射维数呈线性依赖关系,在模拟器环境下样本复杂度上界为 $\tilde{O}(H\mathrm{dim}_E(\Theta)(\Delta^{-2} + \varepsilon^{-1}))$,在确定性系统中遗憾(regret)上界为 $O(H\bar{R}\cdot\mathrm{dim}_E(\Theta))$。
We study the optimal sample complexity in large-scale Reinforcement Learning (RL) problems with policy space generalization, i.e. the agent has a prior knowledge that the optimal policy lies in a known policy space. Existing results show that without a generalization model, the sample complexity of an RL algorithm will inevitably depend on the cardinalities of state space and action space, which are intractably large in many practical problems. To avoid such undesirable dependence on the state and action space sizes, this paper proposes a new notion of eluder dimension for the policy space, which characterizes the intrinsic complexity of policy learning in an arbitrary Markov Decision Process (MDP). Using a simulator oracle, we prove a near-optimal sample complexity upper bound that only depends linearly on the eluder dimension. We further prove a similar regret bound in deterministic systems without the simulator.
研究动机与目标
- 解决由于状态空间和动作空间巨大而导致大规模强化学习中样本复杂度过高的挑战。
- 构建一个理论框架,刻画当最优策略位于已知策略类中时策略学习的内在复杂度。
- 设计一种避免对时间跨度呈指数依赖的样本高效探索策略,用于策略学习。
- 利用策略空间的新复杂度度量,建立样本复杂度与遗憾的紧致上下界。
提出的方法
- 提出一种专为马尔可夫决策过程(MDP)中策略类设计的新弹射维数概念 $\mathrm{dim}_E(\Theta)$。
- 提出一种基于堆栈的探索算法,通过追踪独立的状态-动作对来高效引导探索。
- 利用模拟器预言机,实现在具有最优 $Q$-函数 $\Delta$-分离性质的一般 MDP 中高效策略评估与探索。
- 利用弹射维数限制独立探索步数,确保复杂度依赖于内在复杂度而非状态空间大小。
- 通过递归堆栈操作和状态-动作对序列的独立性论证,证明遗憾与样本复杂度的上界。
- 基于策略空间的 Littlestone 维数建立极小化最大遗憾下界,验证上界紧致性。
实验结果
研究问题
- RQ1能否通过策略空间的内在复杂度度量来刻画策略空间泛化下强化学习的样本复杂度?
- RQ2当最优策略位于已知且结构化的策略类中时,如何在大规模 MDP 中实现样本高效的探索?
- RQ3样本复杂度与遗憾对策略空间复杂度的最优依赖关系是什么?该依赖关系应独立于状态与动作空间大小。
- RQ4能否将 bandits 和值函数学习中弹射维数的概念推广至 MDP 中的策略学习?
- RQ5具有策略空间泛化的策略学习的极小化最大遗憾下界是什么?其与现有组合复杂度度量有何关联?
主要发现
- 在具有模拟器的一般 MDP 中,寻找 $\varepsilon$-最优策略的样本复杂度上界为 $\tilde{O}(H\mathrm{dim}_E(\Theta)(\Delta^{-2} + \varepsilon^{-1}))$,且与弹射维数呈线性依赖。
- 在确定性系统中,所提算法实现的遗憾上界为 $O(H\bar{R}\cdot\mathrm{dim}_E(\Theta))$,与时间跨度和状态空间大小无关。
- 极小化最大遗憾的下界与策略空间的 Littlestone 维数成正比,揭示了根本性限制。
- 策略空间的弹射维数是决定样本复杂度的关键因素,而非状态或动作空间的基数。
- 基于堆栈的探索机制确保非最优策略更新次数被限制在 $O((H+1)\mathrm{dim}_E(\Theta))$ 以内,从而实现高效学习。
- 本工作首次为策略学习提供了无需依赖时间跨度或状态空间大小的无模型样本复杂度上界,其仅依赖于策略空间的内在复杂度度量。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。