Skip to main content
QUICK REVIEW

[论文解读] Online Control of Adaptive Large Neighborhood Search using Deep Reinforcement Learning

Robbert Reijnen, Yingqian Zhang|arXiv (Cornell University)|Nov 1, 2022
Advanced Bandit Algorithms Research被引用 4
一句话总结

该论文提出了一种基于深度强化学习(DRL)的框架DR-ALNS,可在线控制自适应大邻域搜索(ALNS)中的操作员选择、破坏严重程度以及模拟退火温度,用于组合优化问题。在IJCAI AI4TSP竞赛的时间依赖性探索问题(具有随机权重和时间窗)上,该方法优于原始ALNS、贝叶斯优化ALNS以及当前最先进的DRL方法,以显著更少的训练数据和计算成本获得了更优的解。

ABSTRACT

The Adaptive Large Neighborhood Search (ALNS) algorithm has shown considerable success in solving combinatorial optimization problems (COPs). Nonetheless, the performance of ALNS relies on the proper configuration of its selection and acceptance parameters, which is known to be a complex and resource-intensive task. To address this, we introduce a Deep Reinforcement Learning (DRL) based approach called DR-ALNS that selects operators, adjusts parameters, and controls the acceptance criterion throughout the search. The proposed method aims to learn, based on the state of the search, to configure ALNS for the next iteration to yield more effective solutions for the given optimization problem. We evaluate the proposed method on an orienteering problem with stochastic weights and time windows, as presented in an IJCAI competition. The results show that our approach outperforms vanilla ALNS, ALNS tuned with Bayesian optimization, and two state-of-the-art DRL approaches that were the winning methods of the competition, achieving this with significantly fewer training observations. Furthermore, we demonstrate several good properties of the proposed DR-ALNS method: it is easily adapted to solve different routing problems, its learned policies perform consistently well across various instance sizes, and these policies can be directly applied to different problem variants.

研究动机与目标

  • 为解决自适应大邻域搜索(ALNS)中静态参数调优与启发式选择的局限性,后者依赖试错法且无法适应动态搜索状态。
  • 开发一种与问题无关的在线学习框架,实现在搜索过程中动态配置ALNS算子和接受准则,以提升解的质量。
  • 减少对大量超参数调优及昂贵优化方法(如网格搜索或随机搜索)的依赖,以优化ALNS参数。
  • 实现高效且可迁移的策略学习,使模型在极少再训练的情况下即可跨不同问题规模迁移使用。
  • 在解的质量和训练效率方面,优于传统ALNS配置以及端到端深度学习基线方法。

提出的方法

  • 训练一个深度Q网络(DQN)智能体,基于当前搜索状态选择ALNS中的破坏与修复算子,奖励信号来源于解质量的提升。
  • DRL智能体同时控制ALNS的两个关键超参数:破坏严重程度(控制解的破坏程度)和模拟退火温度(控制对劣质解的接受程度)。
  • 状态表示包括算子性能历史、当前解质量以及时间窗、随机行驶时间等特定于问题的特征。
  • 智能体通过在一组问题实例上进行强化学习训练,学习在搜索过程中实时平衡探索与利用。
  • 该框架设计为与问题无关,仅需定义状态空间和动作空间,无需对新组合优化问题(COP)进行架构修改。
  • 训练在较小实例上进行,通过在更大、未见过的实例上评估泛化能力,以检验迁移性能。

实验结果

研究问题

  • RQ1DRL智能体能否在复杂组合优化问题上实时有效学习算子选择与参数配置,以提升解的质量?
  • RQ2所提出的DR-ALNS方法在随机性、时间依赖性的路由问题上,与原始ALNS及经贝叶斯优化调优的ALNS相比,性能如何?
  • RQ3DRL智能体是否能在不同问题规模间实现泛化,从而实现从小规模到大规模实例的迁移学习?
  • RQ4所提出方法是否能在显著更少的训练数据和计算成本下,优于端到端DRL基线方法?
  • RQ5在线自适应控制ALNS参数在多大程度上优于静态或离线调优的配置?

主要发现

  • DR-ALNS在所有测试实例规模(20、50、100名客户)下均优于原始ALNS和经贝叶斯优化调优的ALNS,平均找到更优的解。
  • 尽管仅需0.5至10小时的训练时间(而基线方法需数天或48小时),DR-ALNS在性能上仍优于两种当前最先进的DRL基线方法——Rise_up和Ratel。
  • DR-ALNS展现出强大的泛化能力:在20个节点实例上训练的模型,在50和100个节点实例上的表现优于直接在这些规模上训练的模型。
  • 在较大实例(50和100个节点)上训练的模型,在部署到较小实例(20和50个节点)时性能进一步提升,表明其具备极强的迁移能力。
  • 尽管推理时间略有增加(例如100个节点实例为208秒),DR-ALNS在收敛曲线中显示其比基线ALNS方法更快找到更优解。
  • 训练过程计算效率高,仅需标准CPU上0.5至10小时,远低于端到端方法的数天时间,凸显其可扩展性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。