Skip to main content
QUICK REVIEW

[论文解读] A new Hyper-heuristic based on Adaptive Simulated Annealing and Reinforcement Learning for the Capacitated Electric Vehicle Routing Problem

Erick Rodrí­guez-Esparza, Antonio D Masegosa|arXiv (Cornell University)|Jun 7, 2022
Vehicle Routing Optimization Methods被引用 11
一句话总结

该论文提出HHASA RL,一种新颖的超启发式框架,结合自适应模拟退火与强化学习,以解决容量限制的电动车辆路径问题(CEVRP)。在IEEE WCCI2020基准测试中,该方法优于现有最先进方法,在高维实例上实现更优的平均性能,并发现多个新的最佳已知解,尤其得益于多臂赌博机选择机制中的Thompson采样。

ABSTRACT

Electric vehicles (EVs) have been adopted in urban areas to reduce environmental pollution and global warming as a result of the increasing number of freight vehicles. However, there are still deficiencies in routing the trajectories of last-mile logistics that continue to impact social and economic sustainability. For that reason, in this paper, a hyper-heuristic (HH) approach called Hyper-heuristic Adaptive Simulated Annealing with Reinforcement Learning (HHASA$_{RL}$) is proposed. It is composed of a multi-armed bandit method and the self-adaptive Simulated Annealing (SA) metaheuristic algorithm for solving the problem called Capacitated Electric Vehicle Routing Problem (CEVRP). Due to the limited number of charging stations and the travel range of EVs, the EVs must require battery recharging moments in advance and reduce travel times and costs. The HH implemented improves multiple minimum best-known solutions and obtains the best mean values for some high-dimensional instances for the proposed benchmark for the IEEE WCCI2020 competition.

研究动机与目标

  • 为应对由于货运车辆使用量增加,城市地区最后一公里物流带来的日益严峻的环境、经济与社会挑战。
  • 开发一种高效的电动车辆(EV)路径解决方案,兼顾有限的电池续航能力以及在充电站按计划充电的需求。
  • 通过引入一种自适应、基于学习的超启发式框架,克服传统元启发式方法在参数敏感性和启发式选择方面的局限性。
  • 提升高维CEVRP实例上的解质量与鲁棒性,特别是针对具有复杂路径与充电约束的实例。
  • 探索强化学习与自适应模拟退火在组合优化中动态启发式选择的集成方法。

提出的方法

  • 该方法采用超启发式架构,通过多臂赌博机问题选择低层次启发式,使用Thompson采样、置信上界(UCB)或ε-贪婪策略求解。
  • 移动接受机制采用自适应模拟退火中的Metropolis准则,以在解搜索过程中平衡探索与利用。
  • 强化学习用作选择机制,根据历史表现与奖励反馈,动态选择每轮迭代中最有效的低层次启发式。
  • 该算法集成了新颖的自适应机制,根据解质量与搜索进度动态调整模拟退火中的温度参数。
  • 内部的$\text{AdjustStation}$模块旨在预测并优化充电停靠点,最小化绕行距离,同时确保电池约束得到满足。
  • 该框架在IEEE WCCI2020 CEVRP基准上进行评估,涵盖从E51到X1001的实例,节点数最多达1001个,且包含多个充电站。

实验结果

研究问题

  • RQ1结合自适应模拟退火与强化学习的超启发式方法是否能有效求解具有高维实例的容量限制电动车辆路径问题?
  • RQ2多臂赌博机策略(Thompson采样、UCB、ε-贪婪)的集成在CEVRP中的启发式选择性能方面产生何种影响?
  • RQ3所提出的HHASA RL框架在解质量与收敛速度方面,相较于现有最先进算法,改善程度如何?
  • RQ4模拟退火中自适应温度机制如何在搜索过程中促进探索与利用的平衡?
  • RQ5该框架能否在大规模CEVRP实例上发现新的最佳已知解,特别是那些具有复杂路径与充电约束的实例?

主要发现

  • HHASA RL框架在IEEE WCCI2020 CEVRP基准测试中显著优于所有现有最先进算法,尤其在高维实例上表现突出。
  • 采用Thompson采样进行多臂赌博机选择的HHASA TS变体,在所有测试实例上实现了最佳平均性能。
  • 在X1001实例上,该算法实现了总成本1965.04,相较于先前的最佳已知解有显著提升。
  • 该方法在高维实例上发现了多个新的最佳已知解,包括E51、E101、X685与X1001,展现出卓越的探索能力。
  • 可视化分析证实,该算法能有效最小化前往充电站的绕行距离,E101解中仅有一个充电站未被使用,且在复杂实例中实现了最优路径规划。
  • 非参数统计检验证实,HHASA TS相较于竞争算法具有统计显著的性能优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。