[논문 리뷰] A new Hyper-heuristic based on Adaptive Simulated Annealing and Reinforcement Learning for the Capacitated Electric Vehicle Routing Problem
이 논문은 적응형 시뮬레이티드 어닐링과 강화학습을 융합한 새로운 초휴리스틱 프레임워크인 HHASA RL을 제안한다. 이 프레임워크는 용량 제약이 있는 전기차량 경로 문제(Capacitated Electric Vehicle Routing Problem, CEVRP)를 해결하기 위해 개발되었으며, IEEE WCCI2020 벤치마크에서 최신 기술 수준의 방법들을 능가한다. 특히 다중 선택 기회 문제의 톰슨 샘플링 기반 선택 메커니즘을 통해 고차원 인스턴스에서 뛰어난 평균 성능을 달성하였고, 여러 개의 새로운 최고 기록 솔루션을 발견하였다.
Electric vehicles (EVs) have been adopted in urban areas to reduce environmental pollution and global warming as a result of the increasing number of freight vehicles. However, there are still deficiencies in routing the trajectories of last-mile logistics that continue to impact social and economic sustainability. For that reason, in this paper, a hyper-heuristic (HH) approach called Hyper-heuristic Adaptive Simulated Annealing with Reinforcement Learning (HHASA$_{RL}$) is proposed. It is composed of a multi-armed bandit method and the self-adaptive Simulated Annealing (SA) metaheuristic algorithm for solving the problem called Capacitated Electric Vehicle Routing Problem (CEVRP). Due to the limited number of charging stations and the travel range of EVs, the EVs must require battery recharging moments in advance and reduce travel times and costs. The HH implemented improves multiple minimum best-known solutions and obtains the best mean values for some high-dimensional instances for the proposed benchmark for the IEEE WCCI2020 competition.
연구 동기 및 목표
- 증가하는 화물 차량 사용으로 인한 도시 지역의 최종 배송 물류 분야에서의 환경적, 경제적, 사회적 과제를 해결하기 위해.
- 제한된 배터리 용량과 충전소에서의 정기적 충전이 필요한 전기차량(EVs)을 위한 효율적인 경로 계획 솔루션을 개발하기 위해.
- 기존 메타휴리스틱 기법의 파rameter 민감도 및 휴리스틱 선택의 한계를 극복하기 위해, 자가 적응형이며 학습 기반의 초휴리스틱 프레임워크를 도입하기 위해.
- 특히 복잡한 경로 및 충전 제약 조건을 수반하는 고차원 CEVRP 인스턴스에서 해의 품질과 강건성을 향상시키기 위해.
- 조합 최적화 문제에서의 동적 휴리스틱 선택을 위해 강화학습과 적응형 시뮬레이티드 어닐링의 통합을 탐색하기 위해.
제안 방법
- 저수준 휴리스틱의 선택은 다중 선택 기회 문제(Multi-Armed Bandit Problem)를 통해 수행되며, 이는 톰슨 샘플링, 상한 신뢰도 기반(Upper Confidence Bound, UCB), 또는 ε-그리디 전략을 사용하여 해결된다.
- 이동 수용 메커니즘은 자가 적응형 시뮬레이티드 어닐링에서 유래한 메트로폴리스 기준을 사용하여 해 탐색 과정에서 탐색과 이용의 균형을 유지한다.
- 강화학습은 이력 성능과 보상 피드백에 기반하여 각 반복에서 가장 효과적인 저수준 휴리스틱을 동적으로 선택하는 선택 메커니즘으로 사용된다.
- 알고리즘은 시뮬레이티드 어닐링의 온도 파ram터를 해 품질과 탐색 진행 상황에 따라 적응적으로 조정하는 새로운 적응 메커니즘을 통합한다.
- 내부의 $\text{AdjustStation}$ 블록은 충전 정류장을 사전에 예측하고 최적화하여 도로 이탈을 최소화하고 배터리 제약 조건을 준수하도록 설계되었다.
- 프레임워크는 E51부터 X1001까지의 노드 수가 최대 1001개이고 충전소가 여러 개 존재하는 인스턴스를 포함한 IEEE WCCI2020 CEVRP 벤치마크에서 평가되었다.
실험 결과
연구 질문
- RQ1적응형 시뮬레이티드 어닐링과 강화학습을 융합한 초휴리스틱이 고차원 인스턴스를 포함한 용량 제약이 있는 전기차량 경로 문제를 효과적으로 해결할 수 있는가?
- RQ2다중 선택 기회 문제 전략(톰슨 샘플링, UCB, ε-그리디)의 통합이 CEVRP에서 휴리스틱 선택 성능에 어떤 영향을 미치는가?
- RQ3제안된 HHASA RL 프레임워크는 기존 최신 기술 수준의 알고리즘 대비 해 품질과 수렴 속도 측면에서 어느 정도 향상되었는가?
- RQ4시뮬레이티드 어닐링에서의 자가 적응형 온도 메커니즘이 탐색 과정에서 탐색과 이용의 균형을 어떻게 기여하는가?
- RQ5이 프레임워크는 특히 복잡한 경로 및 충전 제약 조건을 수반하는 대규모 CEVRP 인스턴스에서 새로운 최고 기록 솔루션을 발견할 수 있는가?
주요 결과
- HHASA RL 프레임워크는 IEEE WCCI2020 CEVRP 벤치마크에서 모든 최신 기술 수준의 알고리즘을 뛰어넘었으며, 특히 고차원 인스턴스에서 두드러진 성능을 보였다.
- 톰슨 샘플링을 사용한 HHASA TS 변종은 모든 테스트 인스턴스에서 가장 뛰어난 평균 성능를 달성하였다.
- X1001 인스턴스에서 총 비용은 1965.04로 이전 최고 기록 솔루션 대비 뚜렷한 향상을 보였다.
- E51, E101, X685, X1001과 같은 고차원 인스턴스에서 여러 개의 새로운 최고 기록 솔루션을 발견하여 뛰어난 탐색 능력을 입증하였다.
- 시각적 분석을 통해 알고리즘이 충전소로의 도로 이탈을 효과적으로 최소화했으며, E101 해에서는 단 한 곳의 충전소만 사용되지 않았고, 복잡한 인스턴스에서도 최적의 경로가 확보되었다.
- 비모수적 통계 검정을 통해 HHASA TS가 경쟁 알고리즘 대비 성능 우위가 통계적으로 유의미하다는 것이 확인되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.