[论文解读] Extended Markov Games to Learn Multiple Tasks in Multi-Agent Reinforcement Learning
本文提出了扩展马尔可夫博弈(EMG),这是一种形式化框架,使多个强化学习智能体能够同时学习并满足以共安全LTL表达的多个非马尔可夫规范。通过将基于逻辑的强化学习算法(如LPOPL和I-LPOPL)扩展至多智能体环境,该方法实现了多种时序逻辑任务的协作策略学习,实证结果表明通过智能体协作可提升性能,但代价是计算需求增加。
The combination of Formal Methods with Reinforcement Learning (RL) has recently attracted interest as a way for single-agent RL to learn multiple-task specifications. In this paper we extend this convergence to multi-agent settings and formally define Extended Markov Games as a general mathematical model that allows multiple RL agents to concurrently learn various non-Markovian specifications. To introduce this new model we provide formal definitions and proofs as well as empirical tests of RL algorithms running on this framework. Specifically, we use our model to train two different logic-based multi-agent RL algorithms to solve diverse settings of non-Markovian co-safe LTL specifications.
研究动机与目标
- 解决在多智能体系统中训练多个强化学习智能体以满足多个非马尔可夫任务规范的挑战。
- 将形式化方法——特别是时序逻辑与奖励机器——扩展至多智能体强化学习,以实现可扩展、安全且协调的策略学习。
- 形式化构建一个通用的数学模型——扩展马尔可夫博弈(EMG),该模型将马尔可夫博弈泛化,以支持超越对抗性或单任务场景的多样化时序逻辑规范。
- 通过在协作环境中对共安全LTL规范使用逻辑引导的多智能体强化学习算法,实证验证该框架的有效性。
- 探讨在具有动态课程学习的多智能体环境中,学习速度、计算成本与性能之间的权衡。
提出的方法
- 提出扩展马尔可夫博弈(EMG)作为马尔可夫博弈的推广,通过从共安全LTL规范导出的确定性有限自动机(DFA)引入非马尔可夫奖励结构。
- 提出从LTL规范到奖励机器和DFA的正式映射,使非马尔可夫任务在多智能体环境中的奖励塑造成为可能。
- 将单智能体基于逻辑的强化学习算法(LPOPL和I-LPOPL)改编为多智能体变体(I-LPOPL),以支持在共享时序逻辑约束下的独立学习。
- 采用课程学习策略,使智能体按顺序在不同规范上进行训练,性能通过在所有任务上使用贪婪策略进行评估。
- 为每个智能体和每个规范(或子规范)使用独立的Q网络,并在训练期间将策略更新同步至当前行为策略。
- 采用模型检测与形式化验证原则,确保所学策略满足指定的LTL属性,特别是共安全LTL属性。
实验结果
研究问题
- RQ1多智能体强化学习能否通过形式化方法有效扩展,以学习多个非马尔可夫规范?
- RQ2如何将共安全LTL中的时序逻辑规范正式集成到多智能体学习框架中,以指导策略优化?
- RQ3在将基于逻辑的单智能体强化学习算法扩展至多智能体环境时,性能与可扩展性之间的权衡是什么?
- RQ4当通过共享奖励结构学习多个LTL规范时,多智能体系统中的协作行为如何涌现?
- RQ5训练课程选择与策略更新策略的选择对多智能体逻辑引导强化学习中学习稳定性与性能有何影响?
主要发现
- I-LPOPL在多智能体环境中优于LPOPL,得益于协作策略(如一个智能体取物品,另一个智能体携带工具等待),提升了任务完成效率。
- 在单智能体地图中,I-DQN-l获得的奖励高于DQN-l,表明多智能体协作在任务执行中具有优势。
- I-LPOPL在训练50k步后性能下降,原因是网络更新时未主动使用行为策略,导致协作策略遗忘,表明策略稳定性存在挑战。
- I-LPOPL的计算时间(11.32–14.28小时)远高于I-DQN-l(1.57–2.15小时),主要因每个智能体每个子规范均需一个DQN,显著增加了模型复杂度。
- 该框架成功使多智能体系统能够学习并满足多样化的共安全LTL规范,包括顺序和无序任务集,经由三次独立运行的平均奖励曲线与分位数验证。
- 结果证实,形式化方法可有效集成至多智能体强化学习中,以支持安全的多任务学习,EMG为这类扩展提供了通用的数学基础。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。