[论文解读] Online Planner Selection with Graph Neural Networks and Adaptive Scheduling
该论文提出了一种基于图神经网络(GNN)的在线规划求解器选择方法,利用规划任务的提升图与实例图结构,提升求解器预测准确率,优于2018年IPC最优赛道冠军Delfi。该方法进一步引入一种自适应两阶段调度策略,在上半场若首个求解器失败则切换至第二个求解器,使测试集上求解任务数最高提升89.7%。
Automated planning is one of the foundational areas of AI. Since no single planner can work well for all tasks and domains, portfolio-based techniques have become increasingly popular in recent years. In particular, deep learning emerges as a promising methodology for online planner selection. Owing to the recent development of structural graph representations of planning tasks, we propose a graph neural network (GNN) approach to selecting candidate planners. GNNs are advantageous over a straightforward alternative, the convolutional neural networks, in that they are invariant to node permutations and that they incorporate node labels for better inference. Additionally, for cost-optimal planning, we propose a two-stage adaptive scheduling method to further improve the likelihood that a given task is solved in time. The scheduler may switch at halftime to a different planner, conditioned on the observed performance of the first one. Experimental results validate the effectiveness of the proposed method against strong baselines, both deep learning and non-deep learning based. The code is available at \url{https://github.com/matenure/GNN_planner}.
研究动机与目标
- 通过利用任务的结构图表示,提升自动化规划中在线求解器选择的性能。
- 克服基于CNN的方法(如Delfi)缺乏排列不变性且忽略节点标签的局限性。
- 开发一种自适应调度策略,通过在中场切换求解器,提高在时间限制内求解任务的可能性。
- 评估GNN在提升图与实例图上的表现,以用于求解器选择。
- 探索多种求解器调度策略的影响,包括自适应与贪婪离线方法。
提出的方法
- 使用图神经网络(GNN),特别是GCN与门控GNN,从规划问题的结构图中学习任务表征。
- 构建两类图:实例图(节点级)与提升图(动作级),以编码任务结构,节点颜色表示标签。
- 应用GNN从这些图中提取排列不变且与标签相关的特征,从而在推理上优于基于图像的CNN方法。
- 实现一种两阶段自适应调度器,于中场评估首个求解器的表现,若失败则切换至第二个求解器。
- 采用混合方法:先使用单求解器模型进行初始预测,再通过自适应切换提升在时间约束下的成功率。
- 采用贪婪离线选择方法处理多个求解器,根据在训练/验证集上的表现分配时间片。
实验结果
研究问题
- RQ1与基于图像的CNN表示相比,基于GNN的表征学习是否能提升在线求解器选择性能?
- RQ2在GNN中引入节点标签与排列不变性是否能带来优于CNN的求解器选择效果?
- RQ3在中场切换求解器的自适应调度策略是否能提升在时间限制内求解的任务数量?
- RQ4自适应调度的性能与固定多求解器调度及单求解器方法相比如何?
- RQ5在时间约束下,最大化任务覆盖度的最优求解器数量与调度策略为何?
主要发现
- 所提出的基于GNN的方法优于2018年IPC最优赛道冠军Delfi,在测试集上实现89.7%的任务覆盖度。
- 自适应调度将求解任务数从固定双求解器的85.5%提升至89.7%,相较于单求解器与固定调度方法表现出持续改进。
- 提升图表示始终优于实例图,尽管两者在规模与分布上均更大且更不均衡,带来训练挑战。
- 使用三个求解器的贪婪离线选择实现92.4%的覆盖度,但性能对求解器数量敏感,无单调提升。
- Fast Downward Stone Soup使用四个求解器实现92.4%的覆盖度,与最佳贪婪离线结果相当,但需更复杂的优化。
- 自适应模型优于固定调度,尤其当初始求解器不准确时,因其能根据实时表现动态切换。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。