[论文解读] Neural Simulated Annealing
本文提出神经模拟退火(Neural Simulated Annealing, Neural SA),一种通过轻量、等变神经网络学习提议分布的强化学习增强型模拟退火变体。通过将模拟退火建模为马尔可夫决策过程,该方法在多种组合优化问题中加速了收敛并提升了解的质量,优于原始模拟退火,并与现成求解器相当或更优,同时在计算开销极低的情况下,将学习到的策略泛化至训练实例规模40倍以上的任务中。
Simulated annealing (SA) is a stochastic global optimisation technique applicable to a wide range of discrete and continuous variable problems. Despite its simplicity, the development of an effective SA optimiser for a given problem hinges on a handful of carefully handpicked components; namely, neighbour proposal distribution and temperature annealing schedule. In this work, we view SA from a reinforcement learning perspective and frame the proposal distribution as a policy, which can be optimised for higher solution quality given a fixed computational budget. We demonstrate that this Neural SA with such a learnt proposal distribution, parametrised by small equivariant neural networks, outperforms SA baselines on a number of problems: Rosenbrock's function, the Knapsack problem, the Bin Packing problem, and the Travelling Salesperson problem. We also show that Neural SA scales well to large problems - generalising to significantly larger problems than the ones seen during training - while achieving comparable performance to popular off-the-shelf solvers and other machine learning methods in terms of solution quality and wall-clock time.
研究动机与目标
- 为解决模拟退火中手动调参的挑战,特别是邻居提议分布和温度调度的调参问题。
- 在不依赖昂贵端到端神经架构的前提下,提升组合优化中的收敛速度与解的质量。
- 使学习到的策略能够泛化至训练过程中未见过的更大规模问题实例。
- 在通过可学习组件提升性能的同时,保留经典模拟退火的理论收敛保证。
- 为现实世界优化问题提供一种轻量、训练快速且广泛适用的求解器。
提出的方法
- 本文将模拟退火建模为马尔可夫决策过程(MDP),将提议分布视为需通过强化学习优化的策略。
- 采用小型等变神经网络参数化该策略,根据当前解的状态选择动作(如TSP中的2-opt交换)。
- 使用PPO或进化策略(ES)等策略优化算法进行训练,奖励为基于解质量提升的稀疏奖励。
- 该方法保持Metropolis-Hastings接受准则,确保标准模拟退火的理论收敛性得以保留。
- 框架支持对辅助信息进行条件控制,并可在小规模问题实例上进行短轨迹训练,从而实现向更大规模问题的泛化。
- 每步计算开销为O(N),即使在N较大时也保持可扩展性和高效性。
实验结果
研究问题
- RQ1在多种优化问题中,通过学习得到的提议分布是否能在收敛速度与解质量上优于手工设计的分布?
- RQ2在小规模问题实例上训练的神经策略,能否有效泛化至显著更大的实例?
- RQ3将强化学习集成到模拟退火中,是否能在提升性能的同时保留其理论收敛保证?
- RQ4Neural SA在解质量与实际运行时间方面,与最先进的现成求解器及其他机器学习用于组合优化(ML4CO)方法相比表现如何?
- RQ5仅使用轻量、参数量少的神经网络,是否能在无需大规模数据或复杂架构的前提下实现优异性能?
主要发现
- Neural SA在所有基准问题上均优于原始模拟退火,包括Rosenbrock函数、背包问题、装箱问题和TSP,且仅需极少超参数调优。
- 该方法在所有问题上均达到接近全局最小值的解质量(误差仅几个百分点),与需大量超参数搜索的最先进SA变体相当或更优。
- Neural SA能有效泛化至训练实例规模40倍以上的任务,展现出强大的零样本泛化能力。
- Neural SA的接受率高于经典预期的0.44,与传统认知相悖,暗示其探索效率更高。
- 训练高效——PPO仅需数分钟,ES最多数小时——得益于可学习参数量级为数百,且能从小规模实例中有效泛化。
- 在TSP任务上,PPO在泛化性能上优于ES,尽管ES在贪婪推理下更具鲁棒性;两种方法的接受率均高于原始SA。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。