[논문 리뷰] Neural Combinatorial Optimization with Heavy Decoder: Toward Large Scale Generalization
LEHD를 소개하는 Light Encoder와 Heavy Decoder 모델은 구성 중에 노드 간 관계를 동적으로 업데이트하여 대규모 TSP와 CVRP에 일반화합니다. 학습은 데이터 효율적 감독 방식으로 수행되며 추론 시 Random Re-Construct를 통해 해를 개선합니다.
Neural combinatorial optimization (NCO) is a promising learning-based approach for solving challenging combinatorial optimization problems without specialized algorithm design by experts. However, most constructive NCO methods cannot solve problems with large-scale instance sizes, which significantly diminishes their usefulness for real-world applications. In this work, we propose a novel Light Encoder and Heavy Decoder (LEHD) model with a strong generalization ability to address this critical issue. The LEHD model can learn to dynamically capture the relationships between all available nodes of varying sizes, which is beneficial for model generalization to problems of various scales. Moreover, we develop a data-efficient training scheme and a flexible solution construction mechanism for the proposed LEHD model. By training on small-scale problem instances, the LEHD model can generate nearly optimal solutions for the Travelling Salesman Problem (TSP) and the Capacitated Vehicle Routing Problem (CVRP) with up to 1000 nodes, and also generalizes well to solve real-world TSPLib and CVRPLib problems. These results confirm our proposed LEHD model can significantly improve the state-of-the-art performance for constructive NCO. The code is available at https://github.com/CIAM-Group/NCO_code/tree/main/single_objective/LEHD.
연구 동기 및 목표
- 기존의 구성적 NCO 모델이 대규모 문제에 일반화하는 데 있어 열악한 일반화 문제를 해결한다.
- LEHD 아키텍처를 제안하여 솔루션 구성 중 노드 간 관계를 동적으로 모델링한다.
- 부분 해를 활용한 증강을 통해 데이터 효율적 학습을 개발한다.
- 유연한 추론 개선 메커니즘(Random Re-Construct)을 도입하여 솔루션을 더 정제한다.
제안 방법
- Light Encoder and Heavy Decoder (LEHD) 아키텍처를 제안하되, 경량 인코더는 하나의 어텐션 레이어를, 무거운 디코더는 L개의 어텐션 레이어를 갖는다.
- 디코딩 중 매 스텝에서 시작 노드, 목적지 노드, 사용 가능한 노드를 동적으로 재임베딩하여 규모에 독립적인 관계를 포착한다.
- 부분 해를 임의의 크기와 방향으로 구성하는 지도 학습 방식으로 학습한다(부분 해를 구성하는 방법을 학습한다).
- 탐욕적 추론과 Random Re-Construct(RRC)를 사용하여 예산 내에서 솔루션을 반복적으로 개선한다.
- LEHD를 고전 솔버 및 다수의 NCO 베이스라인과 비교하고 TSP 및 CVRP에서 1000노드까지의 규모를 다룬다.
실험 결과
연구 질문
- RQ1LEHD가 소규모 학습에서 대규모 TSP/CVRP 인스턴스(최대 1000노드)로 일반화할 수 있는가, 문제별 특화 없이?
- RQ2동적 무거운 디코더가 구성적 NCO에서 일반화에 있어 무거운 인코더 설계보다 더 개선되는가?
- RQ3부분 해를 활용한 데이터 효율적 감독 학습이 이 설정에서 RL 기반 접근법과 맞먹거나 능가할 수 있는가?
- RQ4고정된 추론 예산 내에서 Random Re-Construct가 솔루션 품질을 안정적으로 향상시키는가?
주요 결과
- LEHD는 대규모 TSP/CVRP에 대해 강건한 일반화를 달성하며 1000 노드까지의 해법을 경쟁력 있는 간격으로 해결한다.
- 1000 RCC 반복으로 LEHD는 TSP1000에서 거의 최적 간격에 근접하고 CVRP1000에서 특정 예산 하에 1% 미만의 간격을 달성한다.
- LEHD는 여러 학습 기반 베이스라인보다 우수하게 작동하고 충분한 RCC 반복이 있으면 CVRP2xx–CVRP5xx에서도 LKH3에 필적할 수 있다.
- RRC와 부분 해 학습은 POMO나 임의 샘플링 접근법에 비해 우수한 성능에 기여한다.
- 아블레이션은 대규모 인스턴스에 대한 일반화에서 무거운 디코더가 무거운 인코더 설계보다 유리하다는 점을 보여준다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.