Skip to main content
QUICK REVIEW

[论文解读] On Learning Paradigms for the Travelling Salesman Problem

Chaitanya K. Joshi, Thomas Laurent|arXiv (Cornell University)|Oct 16, 2019
Reinforcement Learning in Robotics参考文献 20被引用 21
一句话总结

本文比较了监督学习(SL)与强化学习(RL)范式在训练深度神经网络求解旅行商问题(TSP)中的表现。基于固定规模TSP实例(20–100个节点)的自回归图注意力模型训练表明,尽管两种方法在训练规模下均达到接近最优的性能,但RL在推广至更大、未见过的实例(最多500个节点)时表现出显著更优的泛化能力,归因于基于稀疏奖励的学习机制能够捕捉更广泛的结构模式,从而实现更优的零样本泛化,使RL成为实现尺度不变组合优化求解器的关键驱动力。

ABSTRACT

We explore the impact of learning paradigms on training deep neural networks for the Travelling Salesman Problem. We design controlled experiments to train supervised learning (SL) and reinforcement learning (RL) models on fixed graph sizes up to 100 nodes, and evaluate them on variable sized graphs up to 500 nodes. Beyond not needing labelled data, our results reveal favorable properties of RL over SL: RL training leads to better emergent generalization to variable graph sizes and is a key component for learning scale-invariant solvers for novel combinatorial problems.

研究动机与目标

  • 探究学习范式(监督学习(SL)与强化学习(RL))对深度学习模型在TSP中泛化能力的影响。
  • 评估尽管样本效率较低,RL是否在涌现的泛化能力方面对可变及更大图规模具有优势。
  • 确定基于RL的训练是否能产生比SL更具尺度不变性的策略,后者可能对特定图规模过拟合。
  • 评估在自回归TSP求解器背景下,RL与SL在稳定性和样本效率方面的表现。

提出的方法

  • 训练了两个等效的自回归图注意力网络模型:一个使用REINFORCE算法结合回溯基线(RL),另一个使用交叉熵损失函数与最优解(SL)。
  • 使用固定规模的训练数据(TSP20、TSP50、TSP100),并在TSP20至TSP500的测试集上评估泛化性能。
  • 采用三种解码策略:贪婪搜索、采样(1,280个解)和束搜索(束宽1,280),以评估鲁棒性。
  • 通过在保留的测试集上测量平均路径长度和最优性差距(与最优解的百分比偏差)来评估性能。
  • 开展受控实验以隔离学习范式的影响,保持模型架构、优化器和训练超参数一致。
  • 将回溯基线替换为评论家基线,并将图变换器编码器替换为GCN编码器,以测试结果的稳健性。

实验结果

研究问题

  • RQ1强化学习是否在零样本泛化至训练规模之外的更大、未见过的TSP实例方面优于监督学习?
  • RQ2RL优越的泛化能力是源于学习范式本身,还是依赖于特定模型组件(如图编码器或基线类型)?
  • RQ3不同解码策略(贪婪、采样、束搜索)如何影响SL与RL模型在可变规模TSP实例上的性能与稳定性?
  • RQ4在自回归模型应用于TSP时,RL训练是否与SL一样稳定且样本高效?
  • RQ5基于RL的训练是否能在无需标注数据的情况下,实现组合优化问题的尺度不变求解器?

主要发现

  • 在固定训练规模(TSP20–TSP100)下,SL与RL模型均达到接近最优的性能,SL模型在TSP100上使用束搜索时的最优性差距为0.38%。
  • 在零样本泛化至更大实例(TSP150–TSP500)时,RL模型在所有解码策略下均持续优于SL模型,其中贪婪搜索的性能差距最大。
  • 在TSP500上,RL模型在束搜索下的最优性差距为2.85%,而SL模型为7.79%,表明RL的泛化能力显著更优。
  • 在大规模实例上,基于采样的解码性能劣于贪婪搜索,可能是因为均匀的概率分布表明策略置信度较低。
  • RL与SL在稳定性和样本效率方面表现相当,两者在相同学习率下收敛所需的mini-batch数量相近。
  • RL优越的泛化能力在不同基线(回溯vs.评论家)和图编码器(图变换器vs.GCN)下均保持稳健,证实其源于学习范式本身。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。