[论文解读] Safety-Constrained Reinforcement Learning for MDPs
本文提出了一种用于马尔可夫决策过程(MDPs)的迭代强化学习框架,通过首先计算安全且宽松的调度策略,再通过SMT优化和Q-learning进行细化,确保探索过程中的安全性。该方法在保证安全约束的同时,迭代提升成本最优性,在实际基准测试中实现了全局最优策略,并对期望成本给出了紧致的界。
We consider controller synthesis for stochastic and partially unknown environments in which safety is essential. Specifically, we abstract the problem as a Markov decision process in which the expected performance is measured using a cost function that is unknown prior to run-time exploration of the state space. Standard learning approaches synthesize cost-optimal strategies without guaranteeing safety properties. To remedy this, we first compute safe, permissive strategies. Then, exploration is constrained to these strategies and thereby meets the imposed safety requirements. Exploiting an iterative learning procedure, the resulting policy is safety-constrained and optimal. We show correctness and completeness of the method and discuss the use of several heuristics to increase its scalability. Finally, we demonstrate the applicability by means of a prototype implementation.
研究动机与目标
- 解决在成本事先未知且安全性至关重要的MDP中合成最优控制器的挑战。
- 确保强化学习探索在运行时不会违反安全约束。
- 计算安全且宽松的调度策略,使每个状态允许多个安全动作,从而在安全边界内实现更广泛的探索。
- 通过SMT求解与Q-learning迭代优化策略,收敛至全局最优成本性能。
- 在涉及随机环境与未知成本函数的真实世界基准测试中,展示方法的可扩展性与正确性。
提出的方法
- 首先使用SMT求解计算一个安全且宽松的调度策略,以编码所有不违反安全约束的动作(例如,概率可达性且边界为λ)。
- 将MDP的动作空间限制为仅由宽松调度策略允许的动作,确保所有探索均保持安全。
- 在受限MDP上应用Q-learning,以学习相对于未知成本函数的局部最优策略。
- 在每次学习迭代后,显式排除已学习的策略,以避免未来在宽松调度策略计算中重复,从而探索其他安全策略。
- 使用混合整数线性规划(MILP)高效编码并求解宽松调度策略。
- 维持期望成本的下界与上界;当界收敛或通过已知下界证明全局最优性时终止。
实验结果
研究问题
- RQ1我们能否计算出包含所有安全动作的宽松调度策略,同时保持计算上的可处理性?
- RQ2在执行前成本未知的情况下,如何确保强化学习探索保持安全?
- RQ3何种迭代策略可在成本知识不完整的情况下,实现向全局最优安全策略的收敛?
- RQ4如何结合SMT求解与MILP,以高效计算在安全约束下的宽松调度策略?
- RQ5通过在调度策略空间中采用启发式搜索,可在多大程度上提升宽松性与可扩展性?
主要发现
- 该方法成功为四个真实世界基准测试计算了安全且最优的策略,包括一个带有移动清洁工的机器人导航任务,以及一个具有通信约束的半自主探测器任务。
- 在Janitor与FolLine案例研究中,首次迭代即获得紧致的成本界(下界:84,上界:88.6;以及715.62,716.83),表明具有高度宽松性与早期收敛。
- 在ComExp案例研究中,初始下界较松(0.3),源于低成本的非通信策略,但经过多轮迭代后界显著收紧(例如,7轮后降至78.2),显示出迭代改进效果。
- 原型实现所有基准测试均在2GB内存与2.67GHz CPU下实现收敛,证明了实际可行性。
- 研究发现,高度宽松的调度策略常导致可到达状态空间较小,这是由于求解器对不可达状态的处理行为所致,提示应将宽松性限制在可到达状态上。
- 基于SMT的宽松调度策略计算方法表现有效,但当强制要求目标状态可达时,求解器性能下降,表明可达性与可扩展性之间存在权衡。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。