Skip to main content
QUICK REVIEW

[论文解读] Sym-NCO: Leveraging Symmetricity for Neural Combinatorial Optimization

Min-Su Kim, Junyoung Park|arXiv (Cornell University)|May 26, 2022
Vehicle Routing Optimization MethodsEngineering被引用 18
一句话总结

该论文提出Sym-NCO,一种基于正则化的训练方案,通过利用组合优化问题中的通用对称性(如旋转和反射不变性)来提升基于深度强化学习(DRL)的求解器性能。通过在REINFORCE算法中引入对称性感知基线,Sym-NCO增强了泛化能力和收敛性,在TSP、CVRP、PCTSP和OP任务上均达到最先进性能,且在PCTSP上相比ILS快240倍,优于现有的DRL-NCO方法和传统求解器。

ABSTRACT

Deep reinforcement learning (DRL)-based combinatorial optimization (CO) methods (i.e., DRL-NCO) have shown significant merit over the conventional CO solvers as DRL-NCO is capable of learning CO solvers less relying on problem-specific expert domain knowledge (heuristic method) and supervised labeled data (supervised learning method). This paper presents a novel training scheme, Sym-NCO, which is a regularizer-based training scheme that leverages universal symmetricities in various CO problems and solutions. Leveraging symmetricities such as rotational and reflectional invariance can greatly improve the generalization capability of DRL-NCO because it allows the learned solver to exploit the commonly shared symmetricities in the same CO problem class. Our experimental results verify that our Sym-NCO greatly improves the performance of DRL-NCO methods in four CO tasks, including the traveling salesman problem (TSP), capacitated vehicle routing problem (CVRP), prize collecting TSP (PCTSP), and orienteering problem (OP), without utilizing problem-specific expert domain knowledge. Remarkably, Sym-NCO outperformed not only the existing DRL-NCO methods but also a competitive conventional solver, the iterative local search (ILS), in PCTSP at 240 faster speed. Our source code is available at https://github.com/alstn12088/Sym-NCO.

研究动机与目标

  • 在不依赖问题特定启发式方法的前提下,弥合基于DRL的求解器与传统组合优化求解器之间的性能差距。
  • 通过利用欧几里得组合优化问题中固有的通用对称性,提升DRL-NCO模型的泛化能力和训练效率。
  • 开发一种通用的、与架构无关的训练正则化方案,可在不修改神经网络架构的前提下增强现有DRL-NCO模型的性能。
  • 验证对称性作为强归纳偏置,能够压缩训练空间并促进不变表示的学习。
  • 证明在组合优化任务中,对称性正则化优于等变神经网络,即使后者在理论上保证了等变性。

提出的方法

  • 在REINFORCE算法中引入对称性感知基线,通过采样多个旋转/反射后的问题实例,并将其平均回报作为基线。
  • 采用对称性正则化损失 $\mathcal{L}_{\text{inv}}$,通过最大化对称变换输入表示之间的余弦相似度,强制编码器隐藏状态学习不变表示。
  • 通过旋转增强在训练过程中生成多个问题变体,使策略通过共享优化目标学习对称解。
  • 使用投影头 $g(\cdot)$ 将隐藏表示投影用于对称性正则化,在保持模型表达能力的同时强制实现不变性。
  • 将对称性正则化集成到现有DRL-NCO框架(如POMO)中,无需修改神经架构,实现即插即用的性能提升。
  • 采用多任务训练目标,联合优化标准强化学习损失与对称性正则化损失,以同时优化解的质量与对称性。

实验结果

研究问题

  • RQ1对称性正则化是否能提升DRL-NCO模型在多样化组合优化问题上的泛化能力与收敛性?
  • RQ2利用旋转和反射不变性等通用对称性,是否能带来优于问题特定启发式方法或等变架构的性能表现?
  • RQ3在全连接、基于坐标的图结构的组合优化任务中,对称性正则化是否比架构等变性(如EGNN)更有效?
  • RQ4对称性正则化在多大程度上减少了有效训练空间的大小并提升了样本效率?
  • RQ5对称性正则化是否可普遍应用于现有DRL-NCO模型而无需架构修改,且是否能保持或提升性能?

主要发现

  • Sym-NCO在无需问题特定启发式方法的前提下,显著提升了现有DRL-NCO模型在TSP、CVRP、PCTSP和OP四个组合优化任务上的性能。
  • 在PCTSP基准测试中,Sym-NCO优于传统的迭代局部搜索(ILS)求解器,且速度提升240倍,展现出更优的加速-精度权衡。
  • 对称性正则化损失 $\mathcal{L}_{\text{inv}}$ 提高了对称变换输入表示之间的余弦相似度,证实了有效不变表示学习的实现。
  • 消融实验表明,若对编码器隐藏状态($h$)直接应用对称性正则化,性能会下降,证实投影头 $g(\cdot)$ 对在保持表达能力的同时强制实现不变性至关重要。
  • 尽管EGNN在理论上保证了等变性,但其性能仍劣于Sym-NCO且未能收敛,表明等变性本身不足以保证性能提升——在此情境下,对称性正则化更为有效。
  • Sym-NCO在所有基准数据集上均实现了帕累托最优性能,在相同时间预算下,解的质量全面超越所有基线方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。