[논문 리뷰] A Lightweight CNN-Transformer Model for Learning Traveling Salesman Problems
이 논문은 공간적 특징 학습을 향상시키기 위해 CNN 임bedding 레이어를 도입하고, 디코더에서 부분적 자기주의(self-attention)를 통해 계산 오버헤드를 줄이는 경량 CNN-Transformer 모델을 제안한다. 이 모델은 기존의 Transformer 기반 모델 대비 약 20%의 GPU 메모리 사용량 감소와 45%의 인fer런스 시간 단축을 기록하며, TSP 인스턴스에서 최신 기술(SOTA) 수준의 해의 품질을 달성한다.
Several studies have attempted to solve traveling salesman problems (TSPs) using various deep learning techniques. Among them, Transformer-based models show state-of-the-art performance even for large-scale Traveling Salesman Problems (TSPs). However, they are based on fully-connected attention models and suffer from large computational complexity and GPU memory usage. Our work is the first CNN-Transformer model based on a CNN embedding layer and partial self-attention for TSP. Our CNN-Transformer model is able to better learn spatial features from input data using a CNN embedding layer compared with the standard Transformer-based models. It also removes considerable redundancy in fully-connected attention models using the proposed partial self-attention. Experimental results show that the proposed CNN embedding layer and partial self-attention are very effective in improving performance and computational complexity. The proposed model exhibits the best performance in real-world datasets and outperforms other existing state-of-the-art (SOTA) Transformer-based models in various aspects. Our code is publicly available at https://github.com/cm8908/CNN_Transformer3.
연구 동기 및 목표
- 대규모 TSP 인스턴스를 해결하는 데 있어 표준 Transformer 모델의 높은 계산 복잡도와 GPU 메모리 사용량 문제를 해결하기 위해.
- 표준 임베딩 대신 CNN 기반 임베딩 레이어를 도입하여 TSP에서 공간적 특징 추출을 향상시키기 위해.
- 부분적 자기주의를 통해 디코더에서의 중복된 어텐션 계산을 줄여 효율성을 높이되, 해의 품질을 손상시키지 않기 위해.
- 기존의 최신 기술(SOTA) 기반 Transformer 모델보다 낮은 메모리 사용량과 더 빠른 인fer런스 속도로 더 나은 TSP 해의 품질을 달성하기 위해.
- TSP와 같은 조합 최적화 문제에 대해 더 효율적이고 확장 가능한 딥러닝 솔루션을 제공하기 위해.
제안 방법
- 도시 좌표 입력에서 국소적인 공간 패턴을 더 잘 포착하기 위해 CNN 기반 임베딩 레이어를 도입한다.
- 주의 집중을 관련 있는 토큰들로만 제한하는 부분적 자기주의를 적용한 수정된 Transformer 디코더를 사용하여 레이어의 중복을 줄인다.
- 반복된 도시 방문을 방지하면서 유효한 TSP 투어를 생성하기 위해 자동회귀적 디코딩 전략과 베이머 스크리치(beam search)를 적용한다.
- 기존 모델에서 사용하는 표준 레이어 정규화와는 달리 인코더 및 디코더 블록에 배치 정규화를 적용한다.
- 투어 길이를 최적화 목표로 삼아 지도 학습 방식으로 모델을 훈련시킨다.
- 메모리 소비가 감소함에 따라 훈련 중 더 큰 배치 크기를 사용할 수 있게 되어 훈련 효율성이 향상된다.

실험 결과
연구 질문
- RQ1표준 Transformer와 비교해 CNN-Transformer 하이브리드 모델이 TSP에 대해 공간적 특징 학습을 향상시킬 수 있는가?
- RQ2디코더에서 부분적 자기주의가 해의 품질을 유지하거나 향상시키면서도 계산 오버헤드를 줄일 수 있는가?
- RQ3제안된 모델이 최신 기술(SOTA) 기반의 TSP 솔버보다 더 빠른 인fer런스 속도와 낮은 GPU 메모리 사용량을 기록할 수 있는가?
- RQ4모델은 합성 랜덤 TSP 인스턴스와 kroC100, berlin52와 같은 실세계 TSP 벤치마크에서 어떻게 성능을 발휘하는가?
- RQ5히우리스틱 정밀 조정 기법과 조합했을 때 모델의 성능 향상 정도는 어느 정도인가?
주요 결과
- 제안된 모델은 TSP Transformer 모델 대비 약 20%의 GPU 메모리 사용량 감소를 기록하여 더 큰 배치 크기를 허용한다.
- TSP100에 대해 TSP Transformer 대비 45% 더 빠른 인fer런스 속도를 기록하며, 인fer런스 시간은 51.33초 대비 74.86초를 기록한다.
- kroC100에선 평균 투어 길이 21,523을 기록하여 TSP Transformer의 21,788을 초월한다.
- berlin52에선 평균 투어 길이 7,610을 기록하여 TSP Transformer의 7,637을 뛰어넘는다.
- TSP Transformer(1.41M)보다 略로 많은 파라미터(1.43M)를 사용하지만, 이는 향상된 효율성과 성능로 상쇄된다.
- 랜덤 및 실세계 TSP 인스턴스 양쪽 모두에서 뛰어난 해의 품질을 기록하며, TSP50의 최적성 갭은 0.0004%, TSP100의 최적성 갭은 0.39%를 기록한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.