[论文解读] TauRieL: Targeting Traveling Salesman Problem with a deep reinforcement learning inspired architecture
TauRieL 是一种受深度强化学习启发的旅行商问题(TSP)求解器,采用带有可学习状态转移矩阵的演员-评论家架构,可在数秒内生成接近最优的 TSP 路线。通过在训练与搜索中统一在线学习并利用转移矩阵中的约束转移来保证可行性,其解决方案生成速度比最先进的离线方法快两个数量级,且在 50 个城市实例上仅产生 6.1% 的性能下降。
In this paper, we propose TauRieL and target Traveling Salesman Problem (TSP) since it has broad applicability in theoretical and applied sciences. TauRieL utilizes an actor-critic inspired architecture that adopts ordinary feedforward nets to obtain a policy update vector $v$. Then, we use $v$ to improve the state transition matrix from which we generate the policy. Also, the state transition matrix allows the solver to initialize from precomputed solutions such as nearest neighbors. In an online learning setting, TauRieL unifies the training and the search where it can generate near-optimal results in seconds. The input to the neural nets in the actor-critic architecture are raw 2-D inputs, and the design idea behind this decision is to keep neural nets relatively smaller than the architectures with wide embeddings with the tradeoff of omitting any distributed representations of the embeddings. Consequently, TauRieL generates TSP solutions two orders of magnitude faster per TSP instance as compared to state-of-the-art offline techniques with a performance impact of 6.1\% in the worst case.
研究动机与目标
- 开发一种快速、在线的深度强化学习 TSP 求解器,避免耗时的离线预训练。
- 在单一在线框架中统一训练与搜索,以加速每个 TSP 实例的收敛速度。
- 通过在可学习状态转移矩阵中约束转移,确保路径构造过程中的解可行性。
- 通过使用原始 2D 坐标而非学习到的嵌入向量来减小神经网络规模,从而实现更快的推理速度。
- 在与现有基于深度学习的 TSP 求解器相比,显著降低每个实例的解决方案时间的同时,保持具有竞争力的解质量。
提出的方法
- TauRieL 采用演员-评论家深度强化学习架构,其中演员生成策略更新向量 $ v $,评论家估计预期路径长度。
- 状态转移矩阵通过演员的输出向量 $ v $ 进行更新,表示智能体对环境的随机视角,从而实现在城市转移上的策略学习。
- 最终策略由转移矩阵导出,作为从转移矩阵到当前状态下应访问的下一个城市的确定性映射。
- 转移矩阵允许从预计算的启发式方法(如最近邻)初始化,从而加速收敛。
- 演员和评论家网络分别使用 REINFORCE 算法和随机梯度下降进行训练,输入为原始 2D 坐标,以最小化模型大小。
- 通过在转移矩阵中置零不可行转移(例如,重新访问城市),强制保证仅生成有效路径。
实验结果
研究问题
- RQ1在线深度强化学习框架能否显著快于最先进的离线方法实现 TSP 求解?
- RQ2可学习转移矩阵在统一训练与搜索的同时,对保持解质量的有效性如何?
- RQ3在 TSP 求解器中,使用原始 2D 坐标替代学习到的嵌入向量,在不牺牲性能的前提下,其适用程度如何?
- RQ4将启发式初始化(例如,最近邻)集成到 DRL 框架中,能否提升收敛速度?
- RQ5在 TSP 求解器中,使用在线训练与离线预训练相比,在解质量与速度之间存在怎样的权衡?
主要发现
- TauRieL 生成 TSP 解的速度比最先进的离线深度学习方法快两个数量级。
- 对于 50 个城市实例,TauRieL 相较于最优解的最坏情况性能下降为 6.1%。
- 该求解器可在数秒内获得接近最优的结果,展现出强大的实时适用性。
- 通过使用原始 2D 输入并避免使用宽嵌入向量,TauRieL 保持了更小的神经网络,从而实现更快的推理速度。
- 转移矩阵的集成使得启发式初始化(例如,最近邻)成为可能,从而提升了收敛速度。
- 采用直接更新转移矩阵的演员-评论家架构,实现了在线学习与统一的训练/搜索,减少了对预训练的依赖。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。