[论文解读] Reinforcement Learning-based Non-Autoregressive Solver for Traveling Salesman Problems
该论文提出NAR4TSP,这是首个基于非自回归(NAR)强化学习(RL)求解旅行商问题(TSP)的方法,通过图神经网络(GNN)联合优化可学习的起始节点指针和边得分,同时在训练和推理过程中均施加TSP约束。该方法通过整合自critical强化学习与NAR解码,实现了最先进的解质量、更快的推理速度以及更优的泛化能力,在合成与真实世界的TSP实例上均优于现有模型。
The Traveling Salesman Problem (TSP) is a well-known combinatorial optimization problem with broad real-world applications. Recently, neural networks have gained popularity in this research area because as shown in the literature, they provide strong heuristic solutions to TSPs. Compared to autoregressive neural approaches, non-autoregressive (NAR) networks exploit the inference parallelism to elevate inference speed but suffer from comparatively low solution quality. In this paper, we propose a novel NAR model named NAR4TSP, which incorporates a specially designed architecture and an enhanced reinforcement learning strategy. To the best of our knowledge, NAR4TSP is the first TSP solver that successfully combines RL and NAR networks. The key lies in the incorporation of NAR network output decoding into the training process. NAR4TSP efficiently represents TSP encoded information as rewards and seamlessly integrates it into reinforcement learning strategies, while maintaining consistent TSP sequence constraints during both training and testing phases. Experimental results on both synthetic and real-world TSPs demonstrate that NAR4TSP outperforms five state-of-the-art models in terms of solution quality, inference speed, and generalization to unseen scenarios.
研究动机与目标
- 为解决现有非自回归(NAR)TSP模型存在的解质量低、泛化能力差以及训练-推理约束不一致等问题。
- 开发一种新型NAR模型,将强化学习(RL)与图神经网络(GNN)架构相结合,消除对精确求解器提供的昂贵真实标签的依赖。
- 在训练和推理过程中一致地施加哈密顿回路约束,确保解的可行性与高质量。
- 通过将标准的双模块RL设置替换为单个优化模块,提升样本效率并降低强化学习训练的计算成本。
- 证明NAR模型可实现具有显著更快推理速度的竞争力解质量,适用于实时决策。
提出的方法
- 提出一种改进的GNN架构,以节点坐标和节点间距离作为输入,输出边得分和一个可学习的起始节点指针,实现动态的路径起始。
- 引入一种解码策略,在训练和推理过程中均强制执行TSP的序列约束(即每个节点恰好访问一次形成环路),确保解的可行性。
- 采用自critical强化学习(RL)策略,利用模型自身预测的解作为基线来计算策略梯度,提升训练稳定性和性能。
- 通过将两个相同的子模块替换为单个模块,增强标准RL框架,降低内存使用量和训练时间,同时保持或提升解质量。
- 使用解码得到的TSP路径总长度作为奖励信号,以端到端可微的方式直接优化解质量。
- 在推理阶段采用贪婪解码,利用NAR网络的一次性生成特性,实现高速解生成。
实验结果
研究问题
- RQ1与监督学习基线相比,使用强化学习训练的非自回归模型能否在TSP上实现更优的解质量?
- RQ2在训练阶段即施加TSP约束(而非仅在推理阶段),是否能带来更一致且更高质量的解?
- RQ3可学习的起始节点指针相比固定起始点,能否显著提升解质量?
- RQ4与标准的双模块RL设置相比,所提出的增强型RL策略在效率和性能方面表现如何?
- RQ5NAR4TSP模型在未见的、不同规模和分布的TSP实例上,其泛化能力达到何种程度?
主要发现
- 在TSP50实例上,NAR4TSP的平均解长度为5.752,相比SOTA NAR模型[13]的6.398,解质量提升11.23%。
- 移除可学习指针机制后,相对性能下降6.34%,证明其在路径优化中的关键作用。
- 使用模型确定的起始节点,解长度在10,000个实例中与最佳可能起始节点相比仅相差0.06%,表明选择接近最优。
- 与原始双模块RL设置相比,增强型RL策略将GPU内存使用减少9.89%,训练时间减少26.36%,同时解质量提升0.48%。
- 尽管解质量相近,NAR4TSP在推理阶段相比SOTA NAR模型[13]实现了8.7倍的加速,得益于其一次性解码的特性。
- 该模型在未见TSP实例上表现出良好的泛化能力,展现出对多样化问题分布和规模的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。