[论文解读] Learning to Resolve Conflicts for Multi-Agent Path Finding with Conflict-Based Search
本文提出一种机器学习框架,用于改进多智能体路径规划(MAPF)中基于冲突的搜索(CBS)的冲突选择策略,利用一个最优决策的oracle来指导学习一种快速且可泛化的线性排序函数。该方法显著减少了搜索树规模和运行时间,在多个基准地图上优于当前最先进的CBS求解器。
Conflict-Based Search (CBS) is a state-of-the-art algorithm for multi-agent path finding. At the high level, CBS repeatedly detects conflicts and resolves one of them by splitting the current problem into two subproblems. Previous work chooses the conflict to resolve by categorizing the conflict into three classes and always picking a conflict from the highest-priority class. In this work, we propose an oracle for conflict selection that results in smaller search tree sizes than the one used in previous work. However, the computation of the oracle is slow. Thus, we propose a machine-learning framework for conflict selection that observes the decisions made by the oracle and learns a conflict-selection strategy represented by a linear ranking function that imitates the oracle's decisions accurately and quickly. Experiments on benchmark maps indicate that our method significantly improves the success rates, the search tree sizes and runtimes over the current state-of-the-art CBS solver.
研究动机与目标
- 为解决现有CBS冲突选择策略效率低下的问题,这些策略依赖于固定的优先级规则,可能导致庞大的搜索树。
- 开发一种比最优但计算成本高昂的冲突选择oracle更快、更具泛化能力的替代方案。
- 利用机器学习学习一个排序函数,以模仿oracle的决策,同时保持实时应用的高效性。
- 使该方法能够在不重新训练的情况下泛化到不同数量的智能体和未见过的网格地图。
- 提升CBS在求解MAPF问题时的成功率、搜索树规模和运行时间。
提出的方法
- 设计一个冲突选择oracle,通过使用1步前瞻启发式方法选择冲突,以最小化最优代价的下界。
- 通过观察oracle在多样化MAPF实例上的冲突选择行为来收集训练数据,并为每个冲突提取特征。
- 使用问题特定特征,训练监督式机器学习模型,以学习一个模仿oracle决策的线性排序函数。
- 使用学习到的排序函数来指导CBS中的冲突选择,从而替代oracle以实现更快的执行速度。
- 将学习到的策略集成到CBS中,使其能够在不重新训练的情况下泛化到新地图和智能体数量。
- 使用加权依赖图边、冲突基数和智能体冲突频率等特征来指导排序函数。
实验结果
研究问题
- RQ1机器学习模型能否在MAPF的CBS中模仿一个最优但速度较慢的冲突选择oracle?
- RQ2所学习的冲突选择策略是否能在不同数量的智能体和未见过的网格地图上泛化?
- RQ3与当前最先进的CBS求解器相比,所学习的策略能否减少搜索树规模和运行时间?
- RQ4在CBS中,哪些特征最能预测有效的冲突选择?
- RQ5与固定优先级的冲突选择相比,机器学习引导方法在成功率和效率方面表现如何?
主要发现
- ML-S和ML-O两种机器学习引导的冲突选择策略分别解决了6,000个基准实例中的3,779个和3,758个,而CBSH2仅解决了3,326个,分别实现了10.3%至64.4%的运行时间提升和13.0%至68.2%的搜索树规模减少。
- ML-S在相同地图上对更大数量的智能体也表现出良好的泛化能力,即使其在固定智能体数量下进行训练,也证明了其强大的泛化能力。
- ML-O在未见过的测试地图上训练,其性能优于或至少不逊于ML-S,在仓库、城市、迷宫和游戏地图上均表现优异,表明其具备强大的跨地图泛化能力。
- 学习到的排序函数中最重要的特征与冲突基数、加权依赖图边以及智能体冲突频率相关——这与混合整数线性规划(MILP)求解中的伪代价(pseudocosts)相似。
- 特征选择分析表明,结合最重要的特征(如WDG边权重、冲突频率)可略微提升性能,证实了这些特征的相关性。
- 该方法在困难实例上取得了显著的性能提升,尤其是在智能体数量较多时,CBSH2表现吃力,而ML-S和ML-O仍保持高成功率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。