[论文解读] Accelerating Quadratic Optimization with Reinforcement Learning
本文提出 RLQP,一种基于强化学习的方法,通过实时学习自适应调整 ADMM 步长参数(ρ)来加速二次优化的收敛。在多样化 QP 问题上进行训练后,RLQP 相较于最先进的求解器(如 OSQP)将求解时间减少了高达 3 倍,并在 QPLIB、Netlib LP 和 Maros-Mészáros 基准测试等不同问题类别中展现出出色的泛化能力。
First-order methods for quadratic optimization such as OSQP are widely used for large-scale machine learning and embedded optimal control, where many related problems must be rapidly solved. These methods face two persistent challenges: manual hyperparameter tuning and convergence time to high-accuracy solutions. To address these, we explore how Reinforcement Learning (RL) can learn a policy to tune parameters to accelerate convergence. In experiments with well-known QP benchmarks we find that our RL policy, RLQP, significantly outperforms state-of-the-art QP solvers by up to 3x. RLQP generalizes surprisingly well to previously unseen problems with varying dimension and structure from different applications, including the QPLIB, Netlib LP and Maros-Meszaros problems. Code for RLQP is available at https://github.com/berkeleyautomation/rlqp.
研究动机与目标
- 解决诸如 OSQP 等一阶二次优化方法中长期存在的收敛缓慢问题,这些方法为获得高精度解需要数千轮迭代。
- 通过强化学习学习自适应策略,克服手动或启发式超参数调优(尤其是 ADMM 步长 ρ)的局限性。
- 开发一种可泛化的强化学习策略,在无需重新训练的情况下加速多种 QP 问题类别的收敛,从而实现在控制和机器学习应用中的实时部署。
- 通过在多个问题类别上联合训练或针对特定应用领域定制策略,研究泛化与专业化之间的权衡。
- 证明所学策略在收敛速度和鲁棒性方面优于非自适应和启发式自适应求解器,即使在分布外问题上亦表现优异。
提出的方法
- 将 QP 求解过程建模为强化学习(RL)环境,其中状态为求解器内部状态(原始变量和对偶变量、约束条件),动作为对 ADMM 步长 ρ 的调整,奖励为负迭代次数以最小化求解时间。
- 使用深度强化学习训练神经网络策略 πθ,将求解器状态映射为 ρ 的调整,提出两种形式:标量形式(每轮迭代仅更新一个 ρ)和向量形式(按约束分别更新 ρ)。
- 使用回放缓冲区和经验回放以稳定训练,并采用针对随机化 QP 实例的课程学习方法以提高样本效率。
- 在广泛 QP 问题集(如 QPLIB、Netlib、Maros-Mészáros)上训练通用策略,实现开箱即用的部署;在目标问题类别上训练专用策略,以在重复使用中实现更高性能。
- 将训练好的策略集成到 OSQP 求解器流程中,用学习到的动态更新替代固定的或启发式的 ρ 调整机制。
- 通过使用轻量级神经网络和硬件感知设计优化推理速度,确保策略开销不会抵消收敛收益。
实验结果
研究问题
- RQ1强化学习能否学习到有效且可泛化的策略,以自适应调整 ADMM 步长 ρ 并加速二次优化的收敛?
- RQ2在多样化 QP 问题类别中,基于强化学习的策略与非自适应及启发式自适应求解器相比,性能如何?
- RQ3单一联合训练的强化学习策略在泛化到具有不同维度和结构的未见 QP 问题方面,其泛化能力达到何种程度?
- RQ4针对特定问题类别微调策略是否相比通用策略带来进一步的性能提升?
- RQ5在训练成本、推理延迟以及分布外问题上的鲁棒性方面,RLQP 的实际限制是什么?
主要发现
- 在 QPLIB 基准测试中,RLQP 相较于 OSQP 将求解时间减少了高达 3 倍,尤其在大规模和病态条件问题上表现显著。
- 在 Netlib LP 基准测试中,通用向量形式策略相比 OSQP 实现了 1.30 倍的加速,以运行时间的偏移几何平均值衡量。
- 在 Maros-Mészáros QP 基准测试中,RLQP 的偏移几何平均运行时间比 OSQP 快 1.829 倍,表明其在病态缩放问题上的鲁棒性。
- 通用策略在分布外问题上泛化良好,但部分因分布偏移导致超时,表明仍有改进泛化能力的空间。
- 在特定问题类别上微调的专用策略进一步加速了收敛,表明领域特定的微调可带来额外收益。
- 尽管训练成本较高(在高端硬件上耗时数天),但所得到的策略在推理阶段极为高效,开销极小,使实时部署成为可能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。