[论文解读] Evaluating Curriculum Learning Strategies in Neural Combinatorial Optimization
本文提出一种基于自适应阶梯采样的课程学习策略,以提升神经组合优化(NCO)模型在解决不同规模旅行商问题(TSP)时的性能。通过动态调整任务难度并引入对较小问题的回放机制,该方法有效缓解了灾难性遗忘问题,并实现了更优的泛化能力,在问题规模4至150范围内,其最优性差距优于标准课程学习与均匀采样方法。
Neural combinatorial optimization (NCO) aims at designing problem-independent and efficient neural network-based strategies for solving combinatorial problems. The field recently experienced growth by successfully adapting architectures originally designed for machine translation. Even though the results are promising, a large gap still exists between NCO models and classic deterministic solvers, both in terms of accuracy and efficiency. One of the drawbacks of current approaches is the inefficiency of training on multiple problem sizes. Curriculum learning strategies have been shown helpful in increasing performance in the multi-task setting. In this work, we focus on designing a curriculum learning-based training procedure that can help existing architectures achieve competitive performance on a large range of problem sizes simultaneously. We provide a systematic investigation of several training procedures and use the insights gained to motivate application of a psychologically-inspired approach to improve upon the classic curriculum method.
研究动机与目标
- 为缩小神经组合优化(NCO)模型与经典求解器之间的性能差距,使模型能够在多种问题规模下实现良好泛化。
- 探究课程学习是否能够缓解灾难性遗忘问题,并提升NCO模型在不同TSP实例规模间的知识迁移能力。
- 评估不同采样策略(尤其是基于回放与自适应方法)在模型泛化能力与性能一致性方面的有效性。
- 探索将生物启发、心理机制驱动的训练策略(如自适应阶梯)应用于组合优化深度学习的可行性。
提出的方法
- 采用[19]中提出的注意力机制模型(AM)作为求解不同规模TSP实例的基础架构。
- 设计了一套课程学习框架,按任务难度递增顺序调度训练任务,并根据模型表现动态调整。
- 实现了自适应阶梯采样策略,利用性能阈值(α = 0.05)判断是否提升任务难度,并包含对先前见过的较小问题的回放。
- 将每轮训练的批次数量定义为与当前图规模成比例,以实现不同规模间的数据暴露均衡。
- 采用Held-Karp(HK)下界作为最优性差距计算的参考标准,确保评估的一致性与领域内标准。
- 训练了采用不同采样策略(包括均匀采样、经典课程学习与自适应阶梯)的模型,并在所有问题规模下对比其性能。
实验结果
研究问题
- RQ1课程学习能否提升NCO模型在广泛TSP问题规模下的泛化能力?
- RQ2不同问题规模之间的知识迁移特性如何变化?其变化是否随规模平滑过渡?
- RQ3在逐步增加问题规模的训练过程中,灾难性遗忘在多大程度上限制了模型性能?
- RQ4基于回放的自适应课程策略(如自适应阶梯)是否能优于标准课程学习与均匀采样策略?
- RQ5生物启发的训练策略(如自适应阶梯)是否能有效提升模型性能并减少遗忘?
主要发现
- NCO中不同问题规模之间的知识迁移是可度量的,且变化平滑;从小规模到大规模的迁移程度较高,但随规模增大而逐渐减弱。
- 采用均匀采样训练的模型表现出最一致的性能,但整体最优性差距最高,表明其泛化能力欠佳。
- 经典课程学习虽减少了小规模问题上的性能衰减,但在先前任务上仍存在灾难性遗忘现象。
- 自适应阶梯策略通过动态调整难度与引入回放机制,实现了平均性能与遗忘之间的最佳平衡,优于所有基线方法。
- 最终采用自适应阶梯训练的模型在4至150的所有问题规模下,最优性差距均低于10%,且5次运行的置信区间显示性能稳定。
- 结果表明,对较小问题的回放对于维持跨规模性能至关重要,验证了在NCO中采用自适应、心理机制启发的训练调度策略的必要性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。