[论文解读] Control Frequency Adaptation via Action Persistence in Batch Reinforcement Learning
本文提出动作持续性——在多个决策步骤中重复动作——以适应批量强化学习中的控制频率,提出持久拟合Q-迭代(PFQI)方法,从单一数据集学习不同持续性下的最优策略。该方法建立了性能损失的理论边界,并提出一种启发式方法以选择最优持续性,实验证明在CartPole和Mountain Car等基准环境上显著提升了样本效率与性能。
The choice of the control frequency of a system has a relevant impact on the ability of reinforcement learning algorithms to learn a highly performing policy. In this paper, we introduce the notion of action persistence that consists in the repetition of an action for a fixed number of decision steps, having the effect of modifying the control frequency. We start analyzing how action persistence affects the performance of the optimal policy, and then we present a novel algorithm, Persistent Fitted Q-Iteration (PFQI), that extends FQI, with the goal of learning the optimal value function at a given persistence. After having provided a theoretical study of PFQI and a heuristic approach to identify the optimal persistence, we present an experimental campaign on benchmark domains to show the advantages of action persistence and proving the effectiveness of our persistence selection method.
研究动机与目标
- 解决强化学习中控制频率与样本复杂度之间的权衡,特别是在批量RL设置下。
- 研究动作持续性——即在多个步骤中重复动作——对策略性能与价值函数估计的影响。
- 开发一种无需环境交互即可自动选择最优持续性水平的方法,以提升批量学习中的策略性能。
- 扩展拟合Q-迭代方法以处理持续动作,从而仅从单一数据集即可学习不同控制频率下的最优策略。
- 证明在较高持续性下训练而在较低持续性下部署可获得更优性能,挑战了部署频率应与训练频率一致的假设。
提出的方法
- 将动作持续性定义为在k个连续决策步骤中重复使用同一动作,从而将控制频率降低k倍。
- 理论分析表明,持续贝尔曼算子保持压缩性,在利普希茨连续条件下可收敛至正确的价值函数。
- 提出持久拟合Q-迭代(PFQI),作为FQI的扩展,利用从基础MDP中以∆t₀时间步长收集的数据,学习目标持续性k下的最优Q函数。
- 提出一种基于价值函数差异与状态访问频率的启发式索引,用于在无需环境交互的情况下估计最优持续性。
- 在数据收集阶段使用采样持续性(ksampling)以模拟更高持续性MDP,从而在保持数据效率的同时训练低频动态下的策略。
- 评估在不同持续性下训练的策略,并在多种部署持续性下测试其性能,以识别最佳泛化性能。
实验结果
研究问题
- RQ1在马尔可夫决策过程中,动作持续性如何影响最优策略的性能?
- RQ2在利普希茨连续环境中,能否理论化地界定因增加动作持续性(即降低控制频率)而引入的性能损失?
- RQ3是否可能学习到一个在不同部署持续性下均具有良好泛化能力的单一策略,尤其是在训练与部署频率不一致时?
- RQ4能否通过启发式选择方法在无需额外环境交互的情况下识别出最优部署持续性?
- RQ5在较高持续性下训练而在较低持续性下部署,是否能获得优于在相同持续性下训练与部署的性能?
主要发现
- PFQI能够从单一在基础频率∆t₀下收集的批量数据集中,成功学习到多种持续性水平k下的最优Q函数。
- 在CartPole环境中,使用k=4和k=8训练的策略分别实现了接近最优的回报(284.3±1.6和285.9±1.1),显著优于较低或更高的k值。
- 在给定持续性k下训练的策略,当在更低的持续性k₁ < k下部署时性能有所提升,且当k₁小于k时性能最佳,表明在更高持续性下训练可实现更好的泛化能力。
- 在Mountain Car环境中,采样持续性ksampling=8是使均匀策略能够最终到达目标的必要条件,凸显了持续性在稀疏奖励任务中的重要性。
- 启发式持续性选择方法在不同环境中均成功识别出接近最优的k值,在CartPole和Mountain Car中性能均接近最佳可能的k值。
- 当策略在k下训练并在多个k₁下评估时,最佳性能始终出现在k₁ < k的情况下,表明在更高持续性下训练可提升部署灵活性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。