Skip to main content
QUICK REVIEW

[论文解读] DIMES: A Differentiable Meta Solver for Combinatorial Optimization Problems

Ruizhong Qiu, Zhiqing Sun|arXiv (Cornell University)|Oct 8, 2022
Machine Learning and Data Classification被引用 16
一句话总结

DIMES 提出了一种用于组合优化的可微分元求解器,通过使用紧凑的连续空间对解分布进行参数化,实现了稳定的基于 REINFORCE 的训练和大规模并行采样。该方法在大规模 TSP 和 MIS 问题上取得了最先进性能,无需真实标签监督或问题特定启发式方法,即可扩展至最多 10,000 个节点的图。

ABSTRACT

Recently, deep reinforcement learning (DRL) models have shown promising results in solving NP-hard Combinatorial Optimization (CO) problems. However, most DRL solvers can only scale to a few hundreds of nodes for combinatorial optimization problems on graphs, such as the Traveling Salesman Problem (TSP). This paper addresses the scalability challenge in large-scale combinatorial optimization by proposing a novel approach, namely, DIMES. Unlike previous DRL methods which suffer from costly autoregressive decoding or iterative refinements of discrete solutions, DIMES introduces a compact continuous space for parameterizing the underlying distribution of candidate solutions. Such a continuous space allows stable REINFORCE-based training and fine-tuning via massively parallel sampling. We further propose a meta-learning framework to enable the effective initialization of model parameters in the fine-tuning stage. Extensive experiments show that DIMES outperforms recent DRL-based methods on large benchmark datasets for Traveling Salesman Problems and Maximal Independent Set problems.

研究动机与目标

  • 解决现有深度强化学习(DRL)求解器在处理 NP 难组合优化问题时的可扩展性局限,这些求解器通常在数百个节点以上即失效。
  • 通过引入解分布的连续、可微分参数化,克服自回归 DRL 求解器中稀疏奖励和高解码成本的问题。
  • 通过在问题实例上引入新颖的元学习框架,实现模型参数的有效微调,将每个图视为一个独立任务。
  • 在无需依赖监督数据或手工设计启发式方法的前提下,实现对局部可分解(如 MIS)和不可分解(如 TSP)问题的强性能表现。

提出的方法

  • 使用紧凑的连续空间对候选解的分布进行参数化,支持可微采样和稳定的基于 REINFORCE 的策略梯度更新。
  • 通过单次生成模型参数 θ 来定义自回归策略,逐步构建有效的部分解直至完整解。
  • 应用 REINFORCE 算法,结合在线策略、大规模并行采样,以降低梯度方差并提升训练稳定性。
  • 引入元学习框架,将每个组合优化问题实例视为一个任务,实现在微调过程中对模型参数的有效初始化。
  • 利用自回归结构逐步扩展部分解,通过在有效动作上学习的策略确保可行性。
  • 通过将整数变量二值化为比特序列,将该框架适配至多值问题(如混合整数规划)。

实验结果

研究问题

  • RQ1可微分的连续解分布参数化是否能够实现组合优化问题的可扩展训练与推理?
  • RQ2所提出的元学习策略在多样化组合优化问题实例上如何提升模型泛化能力与微调性能?
  • RQ3在缺乏真实解监督的情况下,强化学习求解器在大规模 TSP 和 MIS 问题上能否超越监督基线与启发式基线?
  • RQ4连续参数化是否能够实现对数万个节点规模图的有效扩展,突破自回归 DRL 求解器的限制?

主要发现

  • DIMES 在大规模 TSP 基准数据集上优于近期 DRL 基求解器,在最多 10,000 个节点的图上实现了接近最优的解。
  • 在最大独立集(MIS)问题上,DIMES 与专用神经求解器相比表现具有竞争力,在大规模 ER-[9000-11000] 图上优于监督基线 Intel。
  • 该方法成功扩展至数万个节点规模的图,而大多数先前的 DRL 求解器在数百个节点后即无法扩展。
  • DIMES 在无需任何真实解监督的情况下实现强性能,完全依赖于来自奖励信号的基于 REINFORCE 的策略梯度。
  • 元学习框架实现了更快且更有效的微调,提升了在多样化问题实例上的泛化能力。
  • 尽管具有通用性,DIMES 在大规模 MIS 上仍逊色于 LwD,原因在于 LwD 对局部可分解问题的并行预测机制具有专门优化优势,表明通用性与效率之间存在权衡。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。