[논문 리뷰] Learning to Solve Multiple-TSP with Time Window and Rejections via Deep Reinforcement Learning
이 논문은 시간 창과 거래 거부가 있는 다중 차량 TSP(mTSPTWR) 문제를 해결하기 위해 새로운 매니저-워커 딥 강화 학습 프레임워크를 제안한다. 그래프 이소모르피즘 네트워크(GIN)는 고객을 차량에 할당하고, 자체 주의(Self-attention) 인코더-디코더는 부분 경로를 최적화한다. 이 방법은 강력한 기준 대비 뛰어난 해의 질과 더 빠른 추론 성능을 달성하며, 더 큰 미사용 인스턴스로의 일반화 능력도 뛰어나다.
We propose a manager-worker framework based on deep reinforcement learning to tackle a hard yet nontrivial variant of Travelling Salesman Problem (TSP), \ie~multiple-vehicle TSP with time window and rejections (mTSPTWR), where customers who cannot be served before the deadline are subject to rejections. Particularly, in the proposed framework, a manager agent learns to divide mTSPTWR into sub-routing tasks by assigning customers to each vehicle via a Graph Isomorphism Network (GIN) based policy network. A worker agent learns to solve sub-routing tasks by minimizing the cost in terms of both tour length and rejection rate for each vehicle, the maximum of which is then fed back to the manager agent to learn better assignments. Experimental results demonstrate that the proposed framework outperforms strong baselines in terms of higher solution quality and shorter computation time. More importantly, the trained agents also achieve competitive performance for solving unseen larger instances.
연구 동기 및 목표
- 시간 창과 고객 거부가 포함된 실용적이지만 복잡한 TSP의 변형을 해결하기 위해.
- 경로 길이와 거부 비율을 최소화하면서 차량 간 하중을 효율적으로 균형 잡는 딥 강화 학습 프레임워크를 설계하기 위해.
- 엔드 투 엔드 훈련을 통해 더 큰, 미사용된 문제 인스턴스로의 일반화를 가능하게 하기 위해.
- 기존의 DRL 및 메타휴리스틱 방법이 병합된 시간적 제약과 다중 차량 제약을 다루는 데에 한계를 극복하기 위해.
- 최악의 부분 경로 비용을 명시적으로 최소화함으로써 차량 이용의 균형을 높이고 서비스 품질을 향상시키기 위해.
제안 방법
- 매니저 에이전트는 워커 에이전트의 피드백을 기반으로 그래프 이소모르피즘 네트워크(GIN)를 사용해 고객을 차량에 할당한다.
- 워커 에이전트는 자체 주의 기반 인코더-디코더 정책 네트워크를 활용해 개별 차량의 경로를 최적화하며, 경로 길이와 거부 비율을 모두 최소화한다.
- 프레임워크는 경로 길이와 거부 비율을 조합한 하이브리드 목적 함수를 사용하며, 매니저의 할당 결정을 이끄는 데 최악의 부분 경로 비용이 활용된다.
- 매니저 및 워커 에이전트는 딥 강화 학습을 통해 공동으로 훈련되며, 워커의 성능 피드백이 매니저의 정책에 영향을 준다.
- 시스템은 합성 mTSPTWR 인스턴스에서 엔드 투 엔드로 훈련되며, 훈련 인스턴스와 더 큰 미사용 인스턴스에서 평가된다.
- 기준 대비 초모수(TS, SA, BA)는 철저히 캘리브레이션되며 표 VII에 기재되어 있으며, 비교 실험에서는 K-means가 초기 군집화에 사용된다.
실험 결과
연구 질문
- RQ1DRL 기반의 매니저-워커 프레임워크는 시간 창과 거래 거부가 있는 mTSPTWR 문제를 효과적으로 해결할 수 있는가?
- RQ2강력한 메타휴리스틱 및 DRL 기준 대비 이 프레임워크는 해의 질과 추론 시간에서 어떻게 비교되는가?
- RQ3훈련된 에이전트가 더 큰, 미사용된 mTSPTWR 인스턴스로 얼마나 잘 일반화되는가?
- RQ4최악의 부분 경로 비용을 최소화하는 하이브리드 목적 함수는 전체 비용 최소화보다 더 균형 잡힌 차량 이용을 이끌어내는가?
- RQ5GIN 기반 매니저는 전체 시스템 비용을 감소시키는 데 있어 고객을 차량에 할당하는 데 얼마나 효과적인가?
주요 결과
- 제안된 프레임워크는 세 가지 강력한 메타휴리스틱 기준 대비(TS, SA, BA)와 적응형 DRL 기준 대비에서 해의 질과 계산 시간 면에서 뚜렷한 승리를 거두었다.
- m=5/10, n=100 인스턴스에서, 이 방법은 하이브리드 비용 3.55와 2.09를 기록했으며 추론 시간은 0.16초였다. 반면 SA는 더 큰 인스턴스에서 1800초 이상을 소요했다.
- 프레임워크는 더 큰 미사용 인스턴스로의 일반화 능력이 뛰어나며, 높은 해의 질과 빠른 추론을 유지한다.
- 아블레이션 연구는 GIN 기반 매니저와 자체 주의 워커 네트워크가 성능 향상에 효과적임을 확인한다.
- 최악의 부분 경로 비용을 최소화하는 하이브리드 목적 함수는 전체 비용 최소화에서 관찰되는 극단적 불균형을 피하는 더 균형 잡힌 차량 할당을 이끈다.
- m=5, n=100 인스턴스에서 이 프레임워크는 0.07%의 거부 비율을 기록했으며 하이브리드 비용은 3.55였고, SA의 3.60 비용과 비교해 뛰어난 성능과 훨씬 빠른 런타임을 확보했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.