[论文解读] Combining Reinforcement Learning and Optimal Transport for the Traveling Salesman Problem
该论文提出了一种用于旅行商问题(TSP)的强化学习模型,该模型用可微分最优传输替代自回归解码,直接预测边的概率,从而实现更快的推理速度和更优的解质量。通过将熵正则化的最优传输作为可微分层集成,该模型在无需可学习解码器的情况下强制执行分配约束,将训练时间减少近50%,GPU显存使用量降低10%,同时在TSP50上将最优性差距降低3倍。
The traveling salesman problem is a fundamental combinatorial optimization problem with strong exact algorithms. However, as problems scale up, these exact algorithms fail to provide a solution in a reasonable time. To resolve this, current works look at utilizing deep learning to construct reasonable solutions. Such efforts have been very successful, but tend to be slow and compute intensive. This paper exemplifies the integration of entropic regularized optimal transport techniques as a layer in a deep reinforcement learning network. We show that we can construct a model capable of learning without supervision and inferences significantly faster than current autoregressive approaches. We also empirically evaluate the benefits of including optimal transport algorithms within deep learning models to enforce assignment constraints during end-to-end training.
研究动机与目标
- 解决依赖于缓慢且内存密集型解码器的自回归深度学习模型在TSP中的计算低效问题。
- 通过在端到端训练过程中强制执行分配约束,提升基于强化学习的TSP求解器的解质量。
- 通过消除可学习解码器模块,加速训练和推理过程。
- 评估在基于Transformer的架构中集成可微分最优传输作为可微分层的影响。
- 通过将边概率预测与序列解码解耦,实现更快的搜索策略,并提升对更大规模TSP实例的可扩展性。
提出的方法
- 模型使用多头Transformer编码器处理城市坐标,生成潜在表示。
- 通过标记表示之间的向量外积生成边概率,形成n×n的热力图。
- 应用熵正则化的最优传输(Cuturi, 2013)作为可微分层,将热力图转换为双随机矩阵,强制执行分配约束。
- 生成的概率矩阵用于通过贪婪搜索或束搜索采样或解码出有效的TSP环游路径。
- 模型采用无监督的策略梯度强化学习进行端到端训练,以最小化环游长度为目标。
- 该方法通过直接预测边概率避免自回归解码,减少序列依赖性和计算开销。
实验结果
研究问题
- RQ1可微分最优传输层是否能在不显著增加计算成本的前提下,提升基于强化学习的TSP求解器的解质量?
- RQ2用可微分最优传输层替代可学习解码器是否能实现更快的训练和推理速度,同时保持或提升解质量?
- RQ3在不同规模的问题中,最优传输约束的集成如何影响TSP解的最优性差距?
- RQ4与先前的自回归模型相比,该提出的架构在更大规模TSP实例(如TSP100)上是否能有效扩展?
- RQ5当边概率通过直接预测而非自回归生成时,束搜索等搜索策略在多大程度上可以被加速和改进?
主要发现
- 与使用可学习解码器的自回归模型相比,该模型将训练时间减少了近50%,GPU显存使用量至少降低了10%。
- 在TSP50上,引入作为可微分层的最优传输使最优性差距降低了3倍,使用束搜索时达到0.52%的差距。
- 在TSP50上,该模型使用束搜索实现0.52%的最优性差距,优于先前的最先进水平,在推理速度上表现更优,同时保持了具有竞争力的解质量。
- 最优传输层对训练时间和GPU使用量的影响极小,尽管强制执行了强结构约束,但额外开销不足5%。
- 由于直接预测边概率,该模型实现了更快的束搜索,支持更大的束宽,从而提升了对解空间的探索能力。
- 在TSP100上的实验表明,最优传输层持续带来优势,证实其在小规模实例之外也具有有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。