[论文解读] Solve Traveling Salesman Problem by Monte Carlo Tree Search and Deep Neural Network
本文提出一种结合深度强化学习与蒙特卡洛树搜索(MCTS)的自学习框架,以无需手工设计特征或标注数据的方式求解旅行商问题(TSP)。通过将TSP转化为树搜索问题,并利用深度神经网络以价值函数估计指导MCTS,该方法在小规模至中等规模实例上达到最先进性能,在大规模问题上也取得相当的结果,展现出在随机、聚类及真实世界图结构上的强大泛化能力。
We present a self-learning approach that combines deep reinforcement learning and Monte Carlo tree search to solve the traveling salesman problem. The proposed approach has two advantages. First, it adopts deep reinforcement learning to compute the value functions for decision, which removes the need of hand-crafted features and labelled data. Second, it uses Monte Carlo tree search to select the best policy by comparing different value functions, which increases its generalization ability. Experimental results show that the proposed method performs favorably against other methods in small-to-medium problem settings. And it shows comparable performance as state-of-the-art in large problem setting.
研究动机与目标
- 开发一种无需依赖手工设计特征或监督数据的自学习端到端TSP框架。
- 通过将蒙特卡洛树搜索与深度强化学习相结合,提升组合优化中的泛化能力。
- 解决现有深度学习模型在TSP中的局限性,如可扩展性差及在大规模或聚类图上的不稳定性。
- 在包括随机、聚类及真实世界TSPLIB实例在内的多种图类型上评估该方法。
提出的方法
- 该框架将TSP转化为树搜索问题,其中每条路径代表一个候选TSP路径。
- 一个深度神经网络将图拓扑编码为64维节点特征,替代人工特征工程。
- 蒙特卡洛树搜索利用神经网络的价值函数指导探索并选择高潜力动作。
- 强化学习通过自生成经验训练网络,采用策略梯度方法进行策略优化。
- MCTS每步执行400次模拟,使用基于UCB1的选择策略,Cp = 0.5以实现最佳探索-利用平衡。
- 使用Adam优化器,学习率为1e-4,在不同规模的合成TSP实例上训练网络。
实验结果
研究问题
- RQ1在无标注数据的情况下,结合MCTS的深度强化学习模型是否能超越监督学习及先前基于强化学习的TSP方法?
- RQ2所提出方法在不同类型TSP实例(包括随机、聚类及真实世界图)上的泛化能力如何?
- RQ3将MCTS与深度神经网络结合是否能提升大规模TSP实例的解质量与稳定性?
- RQ4该方法在基准数据集上的性能与S2V-DQN和AttentionTSP等最先进模型相比如何?
主要发现
- 在随机TSP实例上,该方法在TSP20上的平均最优性差距为1.010,TSP50为1.063,TSP100为1.095,优于Pointer Network,并与S2V-DQN持平。
- 在聚类图上,该方法表现出优于S2V-DQN的稳定性,尤其在TSP100上,最优性差距为1.109,而S2V-DQN为1.082。
- 在最多含76个节点的真实世界TSPLIB实例上,该方法平均最优性差距为1.003,与S2V-DQN的1.002相当。
- 在真实世界实例上,该方法显著优于AttentionTSP,后者性能急剧下降(如eil51实例中为1733,而本方法为442)。
- 在TSP50上训练的模型无需微调即可良好泛化至TSP100,实现1.095的最优性差距,表明其具备强大可扩展性。
- 贝叶斯优化确定Cp = 0.5为MCTS的最优参数,确保了有效的探索-利用权衡。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。