[论文解读] Optimal control in Markov decision processes via distributed optimization
本文提出了一种用于大规模马尔可夫决策过程(MDPs)中带时序逻辑约束的最优控制的分布式优化框架,通过分解技术降低计算复杂度。通过将问题重新表述为稀疏线性规划问题,并应用基于ADMM的块分割算法,该方法实现了可扩展的、可并行化的策略合成,以最大化复杂时序逻辑规范的满足概率,在机器人运动规划实例中实现了接近最优的平均奖励。
Optimal control synthesis in stochastic systems with respect to quantitative temporal logic constraints can be formulated as linear programming problems. However, centralized synthesis algorithms do not scale to many practical systems. To tackle this issue, we propose a decomposition-based distributed synthesis algorithm. By decomposing a large-scale stochastic system modeled as a Markov decision process into a collection of interacting sub-systems, the original control problem is formulated as a linear programming problem with a sparse constraint matrix, which can be solved through distributed optimization methods. Additionally, we propose a decomposition algorithm which automatically exploits, if exists, the modular structure in a given large-scale system. We illustrate the proposed methods through robotic motion planning examples.
研究动机与目标
- 为解决大规模MDP中带时序逻辑约束的集中式最优控制合成的可扩展性限制。
- 开发一种分布式框架,将大型MDP分解为更小的子问题,同时保持全局最优性。
- 通过分布式优化技术,实现大规模MDP控制问题的高效、可并行求解。
- 通过近似与分解,在遍历MDP中同时处理折扣奖励与平均奖励目标。
- 在具有复杂时序逻辑规范的机器人运动规划任务中,验证该方法的有效性。
提出的方法
- 基于模块化结构将大型MDP分解为相互作用的子系统,尤其利用平面图特性实现高效分解。
- 将最优控制问题重新表述为具有稀疏约束矩阵的线性规划问题,以支持分布式求解。
- 应用块分割算法(ADMM的一种变体)以分布式和并行方式求解分解后的问题。
- 在每次迭代中使用邻近算子和投影步骤更新变量,确保收敛至可行且最优的解。
- 实现一种交换与平均机制,以在子系统之间同步变量并强制执行耦合约束。
- 通过使用γ = 0.98的折扣奖励对平均奖励进行近似,以在遍历MDP中提升收敛性与可行性。
实验结果
研究问题
- RQ1基于分解的分布式优化方法是否能有效扩展大规模MDP中带时序逻辑约束的最优控制合成?
- RQ2如何自动利用大规模MDP中的模块化结构以降低计算复杂度?
- RQ3与集中式方法相比,该分布式块分割算法在可行性与收敛性方面保持的程度如何?
- RQ4在遍历MDP的分布式合成中,通过折扣奖励近似平均奖励的方法是否有效?
- RQ5该方法在具有复杂时序逻辑目标的机器人运动规划任务中实际表现如何?
主要发现
- 分布式合成算法在14,284次迭代后终止,获得最优折扣奖励0.9998,经(1−γ)缩放后对应平均奖励为0.02。
- 最终解的不可行性度量为0.016,表明尽管存在平均奖励约束,解仍具有良好的可行性。
- 该方法成功处理了一个由涉及四个区域的复杂时序逻辑规范生成的14状态确定性Büchi自动机(DBA)。
- 块分割算法通过基于惩罚的协调机制,实现了子问题的并行求解,相较于两阶段方法提升了收敛性能。
- 该方法在具有并发可达性与重复性目标的机器人运动规划案例研究中表现出良好的可扩展性与有效性。
- 分解算法高效利用了底层MDP的模块化与弱耦合结构,降低了问题规模并支持并行计算。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。