[论文解读] A Deep Reinforcement Learning Framework For Column Generation
该论文提出 RLCG,这是首个将列生成(CG)加速的深度强化学习框架,通过将列选择建模为序列决策问题。利用图神经网络(GNN)编码线性规划(LP)结构,并结合自定义奖励函数的 Q-learning,RLCG 在切割库存问题(CSP)上平均减少 22.4% 的 CG 迭代次数,在带时间窗的车辆路径问题(VRPTW)上减少 40.9% 的迭代次数,相较于贪心策略。
Column Generation (CG) is an iterative algorithm for solving linear programs (LPs) with an extremely large number of variables (columns). CG is the workhorse for tackling large-scale extit{integer} linear programs, which rely on CG to solve LP relaxations within a branch and price algorithm. Two canonical applications are the Cutting Stock Problem (CSP) and Vehicle Routing Problem with Time Windows (VRPTW). In VRPTW, for example, each binary variable represents the decision to include or exclude a extit{route}, of which there are exponentially many; CG incrementally grows the subset of columns being used, ultimately converging to an optimal solution. We propose RLCG, the first Reinforcement Learning (RL) approach for CG. Unlike typical column selection rules which myopically select a column based on local information at each iteration, we treat CG as a sequential decision-making problem: the column selected in a given iteration affects subsequent column selections. This perspective lends itself to a Deep Reinforcement Learning approach that uses Graph Neural Networks (GNNs) to represent the variable-constraint structure in the LP of interest. We perform an extensive set of experiments using the publicly available BPPLIB benchmark for CSP and Solomon benchmark for VRPTW. RLCG converges faster and reduces the number of CG iterations by 22.4\% for CSP and 40.9\% for VRPTW on average compared to a commonly used greedy policy. Our code is available at https://github.com/chichengmessi/reinforcement-learning-for-column-generation.git.
研究动机与目标
- 为解决列生成(CG)中贪心列选择启发式方法的低效问题,这些方法仅基于即时的简化成本选择列,而未考虑长期收敛性。
- 将 CG 建模为序列决策过程,其中每次迭代中的列选择会影响后续选择及整体收敛速度。
- 通过强化学习学习策略,加速大规模线性规划(含指数级变量)的 CG 收敛,如切割库存问题和带时间窗的车辆路径问题。
- 设计一种有效的课程学习策略,以在无需大量领域特定调优的情况下,跨不同规模和复杂度的问题实例训练强化学习智能体。
- 在迭代次数和总求解时间上均优于传统贪心策略和计算成本较高的前瞻启发式方法。
提出的方法
- 将 LP 中的变量-约束交互关系表示为二分图,并使用图神经网络(GNN)编码状态,以捕捉结构信息。
- 将 CG 中的列选择形式化为马尔可夫决策过程(MDP),其中状态为当前的受限主问题(RMP),动作为选择要添加的列。
- 设计密集型、稀疏型和形状化的奖励函数,惩罚高迭代次数,并鼓励更快收敛至最优解。
- 训练深度 Q 网络(DQN)以学习将状态映射到预期累积奖励的 Q 函数,使智能体能够选择最小化总迭代次数的列。
- 实施一种课程学习策略,从更小、更简单的实例开始,逐步增加复杂度,以提升训练稳定性和泛化能力。
- 使用目标网络和经验回放以稳定训练并提高强化学习算法中的样本效率。
实验结果
研究问题
- RQ1强化学习能否有效应用于列生成,以减少收敛所需的迭代次数?
- RQ2使用强化学习学习序列列选择策略是否优于仅选择最负简化成本列的贪心启发式方法?
- RQ3基于 GNN 的状态表示能否有效编码大规模 CG 问题中线性规划的结构与数值特征?
- RQ4如何设计课程学习策略,以高效训练强化学习智能体,覆盖多样化的 CG 问题实例分布?
- RQ5基于强化学习的列选择策略是否能在不同规模和数据分布的 CSP 与 VRPTW 中实现泛化?
主要发现
- 与贪心策略相比,RLCG 在 BPPLIB 基准上的切割库存问题(CSP)中,平均减少 22.4% 的 CG 迭代次数。
- 与贪心策略相比,RLCG 在 Solomon 基准上的带时间窗车辆路径问题(VRPTW)中,平均减少 40.9% 的 CG 迭代次数。
- 在两个基准测试中,RLCG 的总求解时间均快于贪心策略和计算成本较高的单步前瞻整数规划策略。
- 基于 GNN 的状态表示使强化学习智能体能够泛化至多样化的实例,包括不同数量的物品和车辆。
- 课程学习策略显著提升了训练稳定性和样本效率,使智能体能在广泛的问题实例规模和复杂度范围内实现有效学习。
- 所提出的奖励函数有效引导智能体最小化总迭代次数,表明优化收敛速度可带来优于局部优化的性能表现。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。