Skip to main content
QUICK REVIEW

[논문 리뷰] Self-Improvement for Neural Combinatorial Optimization: Sample without Replacement, but Improvement

Jonathan Pirnay, Dominik G. Grimm|arXiv (Cornell University)|2024. 03. 22.
Neural Networks and Applications인용 수 4
한 줄 요약

이 논문은 신경 조합 최적화를 위한 자기 향상 프레임워크인 Gumbeldore(GD)를 제안한다. GD는 다수의 라운드에 걸쳐 현재 정책으로부터 샘플된 최고의 해를 감독적 복제 방식으로 학습함으로써 모델을 훈련시킨다. 배치 기반의 확률적 비드 서치와 이점 기반 정책 업데이트, 핵심 샘플링을 조합함으로써 GD는 TSP, CVRP 및 특히 JSSP에서 최신 기술 수준(SOTA) 성능을 달성한다. 강화 학습 또는 전문가 트레이젝터리 없이도 성능을 뛰어넘는다.

ABSTRACT

Current methods for end-to-end constructive neural combinatorial optimization usually train a policy using behavior cloning from expert solutions or policy gradient methods from reinforcement learning. While behavior cloning is straightforward, it requires expensive expert solutions, and policy gradient methods are often computationally demanding and complex to fine-tune. In this work, we bridge the two and simplify the training process by sampling multiple solutions for random instances using the current model in each epoch and then selecting the best solution as an expert trajectory for supervised imitation learning. To achieve progressively improving solutions with minimal sampling, we introduce a method that combines round-wise Stochastic Beam Search with an update strategy derived from a provable policy improvement. This strategy refines the policy between rounds by utilizing the advantage of the sampled sequences with almost no computational overhead. We evaluate our approach on the Traveling Salesman Problem and the Capacitated Vehicle Routing Problem. The models trained with our method achieve comparable performance and generalization to those trained with expert data. Additionally, we apply our method to the Job Shop Scheduling Problem using a transformer-based architecture and outperform existing state-of-the-art methods by a wide margin.

연구 동기 및 목표

  • 신경 조합 최적화에서 정책 기반 강화 학습 방법의 높은 계산 비용과 훈련 불안정성 문제를 해결한다.
  • 정확한 해를 도출하는 솔버로부터의 비용이 큰 전문가 해에 의존하는 것을 줄이고, 모델이 생성한 트레이젝터리로부터 자기 지도 학습을 가능하게 한다.
  • 이점 기반 업데이트를 통한 라운드별 비드 서치를 통해 중복을 방지하고 다양성을 향상시킴으로써 해 탐색의 샘플 효율성을 향상시킨다.
  • 복잡한 강화 학습 미세조정이 필요 없도록 하여 대규모 아키텍처(예: 트랜스포머)에서 강력한 일반화를 가능하게 한다.
  • 단순한 문제 무관 문제 훈련 루프인 반복적 자기 복제를 기반으로 한 방법이 전문가 지도 학습 및 강화 학습 기반 방법의 성능을 따라하거나 능가할 수 있음을 입증한다.

제안 방법

  • 각 훈련 에포크에서 현재 정책을 사용해 각 인스턴스당 여러 해를 샘플링하며, 비드 폭 k=32와 배치 기반의 확률적 비드 서치를 4라운드 수행한다.
  • 각 인스턴스의 샘플된 해 집합 중에서 가장 성능이 좋은 해를 지도 학습을 위한 의사 전문가 트레이젝터리로 선정한다.
  • 목표 함수 값의 편차(추정된 이점)에 기반해 시퀀스 확률을 조정하는 증명 가능한 정책 향상 전략을 사용해 정책을 업데이트한다.
  • 탐색과 이용 간 균형을 맞추기 위해 시간이 지남에 따라 상위-p 값이 증가하는 동적 핵심 샘플링 전략을 도입한다.
  • 반복 라운드 동안 검색 트리를 유지하여 복원 추출을 방지하고 다양성과 수렴성을 향상시킨다.
  • 작업 및 기계 기반의 어텐션 메커니즘과 ALiBi 위치 인코딩을 갖춘 트랜스포머 기반 아키텍처에 이 방법을 적용한다.

실험 결과

연구 질문

  • RQ1오직 모델이 생성한 해만을 사용하는 자기 복제 루프가 신경 조합 최적화에서 전문가 지도 학습에 비견되는 성능을 달성할 수 있는가?
  • RQ2중복 및 동일한 해를 최소화함으로써 자기 향상 훈련에서 샘플 효율성을 어떻게 극대화할 수 있는가?
  • RQ3감독적 복제 기반의 단순하고 문제에 무관한 훈련 체계가 대규모 문제에서 복잡한 정책 기반 강화 학습 방법을 얼마나 뛰어나게 성능을 높일 수 있는가?
  • RQ4확률적 비드 서치와 이점 기반 정책 업데이트의 조합이 최소한의 계산 오버헤드로도 해 품질을 크게 향상시킬 수 있는가?
  • RQ5제안된 방법이 일반적으로 정책 기반 강화 학습으로 훈련이 불가능한 대규모 트랜스포머 기반 아키텍처에서도 강력한 일반화를 가능하게 하는가?

주요 결과

  • Gumbeldore는 정확한 솔버 해에 접근할 수 없음에도 불구하고 TSP 및 CVRP에서 전문가 지도 학습과 비교할 만한 성능을 달성한다.
  • 작업 스케줄링 문제(JSSP)에서는 기존 최신 기술 수준의 접근 방식을 크게 능가하며, 강력한 일반화와 확장성의 가능성을 입증한다.
  • 이점 기반 업데이트와 동적 핵심 샘플링의 사용은 샘플 효율성을 크게 향상시켜 대규모 샘플 수요를 줄인다.
  • 강화 학습 없이도 대규모 트랜스포머 기반 모델을 JSSP에 대해 훈련시킬 수 있게 하여 정책 기반 강화 학습 미세조정의 계산 비용 문제를 해결한다.
  • 비드 서치와 점진적 정책 업데이트를 통한 자기 복제 루프는 훈련 에포크 전반에 걸쳐 일관되고 측정 가능한 향상을 이끈다.
  • 이 방법은 문제에 무관하며 TSP, CVRP 및 JSSP와 같은 다양한 조합 최적화 문제에 대해 최소한의 아키텍처나 하이퍼파라미터 조정으로도 효과적으로 작동한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.