[论文解读] Reinforcement Learning Enhanced Quantum-inspired Algorithm for Combinatorial Optimization
该论文提出了一种强化学习(RL)智能体,通过一种新颖的重缩放排名奖励(R3)方法,动态调整量子启发式SimCIM算法中用于伊辛模型优化的正则化参数,以摆脱局部最优解。该方法显著优于基线启发式方法和黑箱优化方法(如CMA-ES),在结合从随机问题预训练的智能体进行迁移学习时,能以高概率发现高质量解。
Quantum hardware and quantum-inspired algorithms are becoming increasingly popular for combinatorial optimization. However, these algorithms may require careful hyperparameter tuning for each problem instance. We use a reinforcement learning agent in conjunction with a quantum-inspired algorithm to solve the Ising energy minimization problem, which is equivalent to the Maximum Cut problem. The agent controls the algorithm by tuning one of its parameters with the goal of improving recently seen solutions. We propose a new Rescaled Ranked Reward (R3) method that enables stable single-player version of self-play training that helps the agent to escape local optima. The training on any problem instance can be accelerated by applying transfer learning from an agent trained on randomly generated problems. Our approach allows sampling high-quality solutions to the Ising problem with high probability and outperforms both baseline heuristics and a black-box hyperparameter optimization approach.
研究动机与目标
- 为解决类似SimCIM的量子启发式组合优化算法中的超参数调优挑战,这些算法需要针对具体问题进行配置才能实现最佳性能。
- 通过使用强化学习自动适应参数,提升伊辛能量最小化问题(等价于最大割问题)的解质量与收敛速度。
- 通过设计一种奖励机制,鼓励探索远离局部最优解的区域,从而克服伊辛优化中许多次优解具有相似能量值的困难。
- 通过利用在随机生成问题上预训练的智能体进行迁移学习,加速新问题实例的训练,提升样本效率。
- 将该方法推广至基于连续松弛的其他离散优化算法,而不仅限于SimCIM和伊辛模型。
提出的方法
- 训练一个强化学习智能体以控制SimCIM算法中的正则化(增益-损失)函数,该函数决定了优化过程中解的动态演化。
- 重缩放排名奖励(R3)机制根据当前解的割值在近期试验中的相对排名分配奖励,对频繁访问的局部最优解给予较低奖励,对更优解则给予固定奖励。
- R3通过使奖励对解的访问频率敏感,实现了稳定的单智能体自对弈训练,从而鼓励智能体探索解空间中新的、更高品质的区域。
- 通过在一组多样化的随机生成伊辛问题实例上预训练RL智能体,随后使用特征逐元素线性调制(FiLM)对目标问题进行微调,实现迁移学习。
- 使用深度强化学习训练智能体的策略网络,辅以评论家网络估计值函数,训练过程通过GPU实现加速。
- 在标准Gset基准实例上评估该方法,将解质量与收敛速度与固定参数的SimCIM和CMA-ES进行对比。
实验结果
研究问题
- RQ1强化学习智能体能否有效自动化SimCIM算法中正则化参数的调优,从而提升伊辛优化问题的解质量?
- RQ2所提出的重缩放排名奖励(R3)机制是否相比标准奖励方案(如R2)能实现更稳定的训练并有效逃离局部最优解?
- RQ3从在随机问题上预训练的智能体进行迁移学习,能在多大程度上加速微调过程,并提升在未见的真实世界问题实例上的性能?
- RQ4与传统启发式方法和黑箱超参数优化方法(如CMA-ES)相比,基于RL增强的SimCIM在性能和样本效率方面表现如何?
- RQ5该方法是否可推广至其他基于连续松弛的离散优化算法,而不仅限于SimCIM和伊辛模型?
主要发现
- R3方法实现了稳定的训练并有效逃离了局部最优解,表现为智能体发现更优解后价值损失显著下降;而R2基线因对局部最优解随机奖励导致训练不稳定。
- 同时采用FiLM与R3的预训练智能体优于消融版本,展现出更快的收敛速度和更高的解质量,迁移学习方法显著减少了达到问题求解所需的训练回合数。
- 在Gset基准的G2实例上,基于R3的智能体在500次微调回合后成功求解了80%的实例,优于手动调参的基线SimCIM(70%)和CMA-ES(53%)。
- 消融研究证实,FiLM与R3均不可或缺:缺少任一组件的智能体表现出显著更慢的收敛速度和更低的解质量。
- RL增强的SimCIM在采样高质量解的概率上优于所有启发式基线和CMA-ES,展现出在多样化问题实例上的鲁棒性与适应性。
- 该方法具有可泛化性,不限于SimCIM或伊辛模型,可应用于任何基于离散优化问题连续松弛的算法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。