[论文解读] Omega-Regular Objectives in Model-Free Reinforcement Learning
本文提出了一种针对马尔可夫决策过程中几乎必然满足ω-正则目标的首个无模型强化学习方法。通过将目标编译为极限确定性Büchi自动机,并将问题简化为几乎必然可达性,该方法使现成的时序差分算法能够在不依赖可能导致最优策略误判的确定性Rabin自动机的情况下,学习到最优策略。
We provide the first solution for model-free reinforcement learning of ω-regular objectives for Markov decision processes (MDPs). We present a constructive reduction from the almost-sure satisfaction of ω-regular objectives to an almost- sure reachability problem and extend this technique to learning how to control an unknown model so that the chance of satisfying the objective is maximized. A key feature of our technique is the compilation of ω-regular properties into limit- deterministic Buechi automata instead of the traditional Rabin automata; this choice sidesteps difficulties that have marred previous proposals. Our approach allows us to apply model-free, off-the-shelf reinforcement learning algorithms to compute optimal strategies from the observations of the MDP. We present an experimental evaluation of our technique on benchmark learning problems.
研究动机与目标
- 解决在马尔可夫决策过程中无模型强化学习的ω-正则目标问题,其中目标以长期行为要求的形式表达,而非标量奖励。
- 解决基于确定性Rabin自动机的先前方法在某些MDP中无法识别最优策略的问题,其原因在于瞬态接受转换可能导致策略误排序。
- 提出一种从几乎必然满足ω-正则目标到几乎必然可达性的构造性归约,使用极限确定性Büchi自动机。
- 通过将目标编译为保留最优策略识别能力的奖励结构,使现成的无模型强化学习算法(如Q-learning)能够应用于未知MDP。
- 证明在参数ζ趋近于1时,所提方法下状态的值近似于目标满足的最大概率,从而确保收敛至最优策略。
提出的方法
- 使用极限确定性Büchi自动机而非确定性Rabin自动机来编译ω-正则目标,以避免瞬态接受转换带来的问题。
- 在原始MDP与Büchi自动机之间构建产品MDP,以建模联合状态-动作行为。
- 基于Büchi自动机的接受条件定义奖励函数,仅在产品MDP中访问接受状态时赋予奖励。
- 在转换后的MDP上使用时序差分学习(如Q-learning)来学习最大化满足ω-正则目标概率的策略。
- 引入参数ζ以控制对瞬态接受转换的敏感度,实现向真实最优策略的渐进收敛。
- 使用Mungojerrie模型检测器验证满足概率并验证强化学习结果。
实验结果
研究问题
- RQ1无模型强化学习能否有效应用于MDP中的ω-正则目标,其中目标是长期行为满足而非累积奖励?
- RQ2为何基于确定性Rabin自动机的先前方法在某些MDP中无法识别最优策略?
- RQ3极限确定性Büchi自动机能否用于构建奖励函数,使现成的强化学习算法能够学习到ω-正则目标的最优策略?
- RQ4所提方法是否能确保当参数ζ趋近于1时,状态的值近似于满足目标的最大概率?
- RQ5在存在随机性的情况下,该方法能否在数值计算中可靠地区分瞬态与遍历性接受转换?
主要发现
- 所提方法在所有测试的MDP中成功学习到ω-正则目标的最优策略,包括先前基于Rabin的方法失败的场景。
- 在延迟模型中,仅当ζ足够高(如0.9999)时,RL算法才能正确识别策略b为最优(概率为1),表明调节ζ对避免策略误排序至关重要。
- 对于twoPairs、riskReward和grid5x5等模型,RL算法实现了1.0的满足概率,与模型检测器结果一致。
- 该方法正确识别出frozenSmall的最大满足概率为0.823,证实了奖励转换的正确性。
- 随着ζ增大,pφ(满足概率)单调递增,表明中间策略的质量逐步提升,与定理3一致。
- 该方法避免了Rabin基方法中常见的满足概率低估问题,如在延迟模型中,Rabin基方法会错误地将pφ赋值为0.5。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。