[论文解读] ScheduleNet: Learn to solve multi-agent scheduling problems with reinforcement learning
ScheduleNet 是一种基于强化学习的去中心化调度器,将多智能体调度问题建模为具有周期性完工时间奖励的半马尔可夫决策过程(semi-MDP)。它使用一种类型感知的图注意力网络(graph attention network)来在图表示中嵌入智能体-任务关系,并学习一种用于顺序任务分配的共享策略,在 mTSP 和 JSP 基准测试中表现优于启发式方法和深度强化学习基线方法,尤其在大规模场景下表现更优。
We propose ScheduleNet, a RL-based real-time scheduler, that can solve various types of multi-agent scheduling problems. We formulate these problems as a semi-MDP with episodic reward (makespan) and learn ScheduleNet, a decentralized decision-making policy that can effectively coordinate multiple agents to complete tasks. The decision making procedure of ScheduleNet includes: (1) representing the state of a scheduling problem with the agent-task graph, (2) extracting node embeddings for agent and tasks nodes, the important relational information among agents and tasks, by employing the type-aware graph attention (TGA), and (3) computing the assignment probability with the computed node embeddings. We validate the effectiveness of ScheduleNet as a general learning-based scheduler for solving various types of multi-agent scheduling tasks, including multiple salesman traveling problem (mTSP) and job shop scheduling problem (JSP).
研究动机与目标
- 开发一种适用于多种多智能体调度问题(mSPs)的通用、实时调度器,例如 mTSP 和 JSP。
- 实现智能体之间的去中心化、协作式协调,以最小化总完成时间(完工时间)。
- 设计一种可扩展的解决方案,能够在不重新训练的情况下泛化到不同数量的智能体和任务。
- 通过采用稳定的训练方案,克服多智能体强化学习中的信用分配和奖励波动问题。
- 在大规模 mSP 上展示优于现有启发式方法和深度强化学习方法的性能。
提出的方法
- 将 mSPs 建模为具有周期性奖励(完工时间)的半马尔可夫决策过程(semi-MDP),并采用去中心化策略学习。
- 将调度状态表示为智能体-任务图,以捕捉复杂的依赖关系。
- 采用类型感知图注意力(TGA)从图中提取关系嵌入,区分智能体节点与任务节点。
- 利用节点嵌入计算任务分配概率,以指导顺序任务分配决策。
- 采用自定义的强化学习训练方案,以在稀疏、周期性的团队奖励下稳定学习过程。
- 在所有智能体上训练单一共享策略,从而实现向更大规模问题实例的迁移能力。
实验结果
研究问题
- RQ1一个单一的、共享的、去中心化的策略能否有效解决多样化的多智能体调度问题?
- RQ2在稀疏、周期性的团队奖励(如完工时间)下,如何学习协作行为?
- RQ3基于图的强化学习方法能否在 mTSP 和 JSP 等不同 mSP 上实现泛化?
- RQ4与现有基线方法相比,所提出方法在大规模 mSP 上的可扩展性如何?
- RQ5何种训练方案能够实现在高方差、组合性 mSP 中的稳定学习?
主要发现
- ScheduleNet 在 mTSP 和 JSP 基准测试中均优于启发式基线方法和现有的深度强化学习方法。
- 该模型在大规模 mSP 实例上实现了更优的完工时间性能,展现出良好的可扩展性。
- 所提出的训练方案相比标准 PPO 显著提升了学习稳定性与最终性能。
- GN-PPO(基于 PPO 的基线)表现逊于 ScheduleNet,原因在于价值函数目标的高波动性以及贝尔曼误差的传播。
- 类型感知图注意力机制有效捕捉了智能体-任务图中的关系结构,从而支持更优的决策。
- 由于共享的、去中心化的策略架构,ScheduleNet 在未见过的问题规模上也表现出良好的泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。