Skip to main content
QUICK REVIEW

[논문 리뷰] Combining Reinforcement Learning and Optimal Transport for the Traveling Salesman Problem

Yong Liang Goh, Wee Sun Lee|arXiv (Cornell University)|2022. 03. 02.
Reinforcement Learning in Robotics인용 수 8
한 줄 요약

이 논문은 자동회귀적 디코딩을 차별화된 최적 운반 이론으로 대체하여 간선 확률을 직접 예측하는 강화학습 모델을 제안한다. 이로 인해 추론 속도가 향상되고 해의 품질도 향상된다. 엔트로피 정규화된 최적 운반 이론을 미분 가능한 레이어로 통합함으로써 학습 가능한 디코더 없이 할당 제약 조건을 강제함으로써, 훈련 시간을 약 50% 단축시키고 GPU 메모리 사용량을 10% 감소시키며, TSP50에서 최적성 갭을 3배 향상시킨다.

ABSTRACT

The traveling salesman problem is a fundamental combinatorial optimization problem with strong exact algorithms. However, as problems scale up, these exact algorithms fail to provide a solution in a reasonable time. To resolve this, current works look at utilizing deep learning to construct reasonable solutions. Such efforts have been very successful, but tend to be slow and compute intensive. This paper exemplifies the integration of entropic regularized optimal transport techniques as a layer in a deep reinforcement learning network. We show that we can construct a model capable of learning without supervision and inferences significantly faster than current autoregressive approaches. We also empirically evaluate the benefits of including optimal transport algorithms within deep learning models to enforce assignment constraints during end-to-end training.

연구 동기 및 목표

  • 자신의 디코더가 느리고 메모리를 많이 소비하는 자동회귀적 딥러닝 모델이 TSP에 대해 계산적으로 비효율적인 문제를 해결하기 위해.
  • 엔드 투 엔드 훈련 중에 할당 제약 조건을 강제하여 강화학습 기반 TSP 솔버의 해 품질을 향상시키기 위해.
  • 학습 가능한 디코더 모듈이 필요 없게 함으로써 훈련과 추론을 가속화하기 위해.
  • Transformer 기반 아키텍처에 미분 가능한 최적 운반 이론을 통합하는 것이 미치는 영향을 평가하기 위해.
  • 간선 확률 예측을 순차적 디코딩에서 분리함으로써 더 빠른 검색 전략과 더 큰 TSP 인스턴스로의 확장성을 가능하게 하기 위해.

제안 방법

  • 모델은 도시 좌표를 처리하고 잠재 표현을 생성하기 위해 멀티헤드 트랜스포머 인코더를 사용한다.
  • 토큰 표현 간의 외적 곱을 통해 간선 확률이 생성되며, 이는 n×n 히트맵을 형성한다.
  • 엔트로피 정규화된 최적 운반 이론(Cuturi, 2013)이 히트맵을 이중 확률 행렬로 변환하기 위한 미분 가능한 레이어로 적용되어 할당 제약 조건을 강제한다.
  • 결과로 생성된 확률 행렬은 그레디 또는 빔 서치를 통해 유효한 TSP 투어를 샘플링하거나 디코딩하는 데 사용된다.
  • 모델은 감독 없이 정책 기반 강화학습을 통해 엔드 투 엔드로 훈련되며, 투어 길이를 최적화한다.
  • 모델은 순차적 종속성과 계산 오버헤드를 줄이기 위해 직접적으로 간선 확률을 예측함으로써 자동회귀적 디코딩을 피한다.

실험 결과

연구 질문

  • RQ1학습 비용이 크게 증가하지 않으면서도, 미분 가능한 최적 운반 이론 레이어가 강화학습 기반 TSP 솔버의 해 품질을 향상시킬 수 있는가?
  • RQ2학습 가능한 디코더를 미분 가능한 최적 운반 이론 레이어로 대체함으로써, 훈련 및 추론 속도가 빨라지면서도 해 품질이 유지되거나 향상되는가?
  • RQ3최적 운반 이론 제약 조건의 통합이 다양한 문제 크기에서 TSP 해의 최적성 갭에 어떤 영향을 미치는가?
  • RQ4기존 자동회귀 모델에 비해 제안된 아키텍처가 더 큰 TSP 인스턴스(예: TSP100)에 효과적으로 확장될 수 있는가?
  • RQ5간선 확률을 자동회귀적 생성이 아닌 직접 예측함으로써, 빔 서치와 같은 검색 전략이 얼마나 빨라지고 향상될 수 있는가?

주요 결과

  • 학습 가능한 디코더를 갖는 자동회귀 모델과 비교해 훈련 시간을 약 50% 단축시키고 GPU 메모리 사용량을 최소 10% 감소시켰다.
  • 미분 가능한 레이어로 최적 운반 이론을 통합함으로써 TSP50에서 최적성 갭이 3배 향상되었으며, 빔 서치를 사용할 경우 갭은 0.52%에 도달했다.
  • TSP50에서 빔 서치를 사용할 경우 0.52%의 최적성 갭을 달성했으며, 이는 추론 속도 면에서 이전 최고 수준의 성능을 넘어서면서도 경쟁 가능한 해 품질을 유지했다.
  • 최적 운반 이론 레이어는 훈련 시간과 GPU 사용량에 거의 영향을 주지 않으며, 강력한 구조적 제약 조건을 강제함에도 불구하고 5% 미만의 오버헤드만 추가했다.
  • 간선 확률을 직접 예측함으로써 빔 서치 속도가 빨라졌으며, 더 넓은 빔 너비를 허용하고 해 공간 탐색의 품질을 향상시킬 수 있었다.
  • TSP100에 대한 실험 결과는 최적 운반 이론 레이어가 소규모 인스턴스를 넘어서도 효과적임을 확인했으며, 일관된 이점을 제공했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.