Skip to main content
QUICK REVIEW

[논문 리뷰] A Lightweight CNN-Transformer Model for Learning Traveling Salesman Problems

Minseop Jung, Jaeseung Lee|arXiv (Cornell University)|2023. 05. 03.
Neural Networks and Applications인용 수 4
한 줄 요약

이 논문은 공간적 특징 학습을 향상시키기 위해 CNN 임bedding 레이어를 도입하고, 디코더에서 부분적 자기주의(self-attention)를 통해 계산 오버헤드를 줄이는 경량 CNN-Transformer 모델을 제안한다. 이 모델은 기존의 Transformer 기반 모델 대비 약 20%의 GPU 메모리 사용량 감소와 45%의 인fer런스 시간 단축을 기록하며, TSP 인스턴스에서 최신 기술(SOTA) 수준의 해의 품질을 달성한다.

ABSTRACT

Several studies have attempted to solve traveling salesman problems (TSPs) using various deep learning techniques. Among them, Transformer-based models show state-of-the-art performance even for large-scale Traveling Salesman Problems (TSPs). However, they are based on fully-connected attention models and suffer from large computational complexity and GPU memory usage. Our work is the first CNN-Transformer model based on a CNN embedding layer and partial self-attention for TSP. Our CNN-Transformer model is able to better learn spatial features from input data using a CNN embedding layer compared with the standard Transformer-based models. It also removes considerable redundancy in fully-connected attention models using the proposed partial self-attention. Experimental results show that the proposed CNN embedding layer and partial self-attention are very effective in improving performance and computational complexity. The proposed model exhibits the best performance in real-world datasets and outperforms other existing state-of-the-art (SOTA) Transformer-based models in various aspects. Our code is publicly available at https://github.com/cm8908/CNN_Transformer3.

연구 동기 및 목표

  • 대규모 TSP 인스턴스를 해결하는 데 있어 표준 Transformer 모델의 높은 계산 복잡도와 GPU 메모리 사용량 문제를 해결하기 위해.
  • 표준 임베딩 대신 CNN 기반 임베딩 레이어를 도입하여 TSP에서 공간적 특징 추출을 향상시키기 위해.
  • 부분적 자기주의를 통해 디코더에서의 중복된 어텐션 계산을 줄여 효율성을 높이되, 해의 품질을 손상시키지 않기 위해.
  • 기존의 최신 기술(SOTA) 기반 Transformer 모델보다 낮은 메모리 사용량과 더 빠른 인fer런스 속도로 더 나은 TSP 해의 품질을 달성하기 위해.
  • TSP와 같은 조합 최적화 문제에 대해 더 효율적이고 확장 가능한 딥러닝 솔루션을 제공하기 위해.

제안 방법

  • 도시 좌표 입력에서 국소적인 공간 패턴을 더 잘 포착하기 위해 CNN 기반 임베딩 레이어를 도입한다.
  • 주의 집중을 관련 있는 토큰들로만 제한하는 부분적 자기주의를 적용한 수정된 Transformer 디코더를 사용하여 레이어의 중복을 줄인다.
  • 반복된 도시 방문을 방지하면서 유효한 TSP 투어를 생성하기 위해 자동회귀적 디코딩 전략과 베이머 스크리치(beam search)를 적용한다.
  • 기존 모델에서 사용하는 표준 레이어 정규화와는 달리 인코더 및 디코더 블록에 배치 정규화를 적용한다.
  • 투어 길이를 최적화 목표로 삼아 지도 학습 방식으로 모델을 훈련시킨다.
  • 메모리 소비가 감소함에 따라 훈련 중 더 큰 배치 크기를 사용할 수 있게 되어 훈련 효율성이 향상된다.
Fig. 1: Overview of the proposed CNN-Transformer model for TSP.
Fig. 1: Overview of the proposed CNN-Transformer model for TSP.

실험 결과

연구 질문

  • RQ1표준 Transformer와 비교해 CNN-Transformer 하이브리드 모델이 TSP에 대해 공간적 특징 학습을 향상시킬 수 있는가?
  • RQ2디코더에서 부분적 자기주의가 해의 품질을 유지하거나 향상시키면서도 계산 오버헤드를 줄일 수 있는가?
  • RQ3제안된 모델이 최신 기술(SOTA) 기반의 TSP 솔버보다 더 빠른 인fer런스 속도와 낮은 GPU 메모리 사용량을 기록할 수 있는가?
  • RQ4모델은 합성 랜덤 TSP 인스턴스와 kroC100, berlin52와 같은 실세계 TSP 벤치마크에서 어떻게 성능을 발휘하는가?
  • RQ5히우리스틱 정밀 조정 기법과 조합했을 때 모델의 성능 향상 정도는 어느 정도인가?

주요 결과

  • 제안된 모델은 TSP Transformer 모델 대비 약 20%의 GPU 메모리 사용량 감소를 기록하여 더 큰 배치 크기를 허용한다.
  • TSP100에 대해 TSP Transformer 대비 45% 더 빠른 인fer런스 속도를 기록하며, 인fer런스 시간은 51.33초 대비 74.86초를 기록한다.
  • kroC100에선 평균 투어 길이 21,523을 기록하여 TSP Transformer의 21,788을 초월한다.
  • berlin52에선 평균 투어 길이 7,610을 기록하여 TSP Transformer의 7,637을 뛰어넘는다.
  • TSP Transformer(1.41M)보다 略로 많은 파라미터(1.43M)를 사용하지만, 이는 향상된 효율성과 성능로 상쇄된다.
  • 랜덤 및 실세계 TSP 인스턴스 양쪽 모두에서 뛰어난 해의 품질을 기록하며, TSP50의 최적성 갭은 0.0004%, TSP100의 최적성 갭은 0.39%를 기록한다.
Fig. 2: Proposed encoder architecture with the CNN embedding layer and $L$ identical encoder layers.
Fig. 2: Proposed encoder architecture with the CNN embedding layer and $L$ identical encoder layers.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.