[论文解读] Self-Supervised Primal-Dual Learning for Constrained Optimization
本文提出原始-对偶学习(PDL),一种自监督方法,通过模仿增广拉格朗日法(ALM)的轨迹,联合训练原始和对偶神经网络,以逼近约束优化问题的解。与监督方法不同,PDL在训练过程中无需预先求解的实例或优化求解器,可在包括二次规划(QP)、二次锥规划(QCQP)和交流最优潮流(AC-OPF)问题在内的非线性基准测试中实现可忽略的约束违反和微小的最优性差距——与ALM相当。
This paper studies how to train machine-learning models that directly approximate the optimal solutions of constrained optimization problems. This is an empirical risk minimization under constraints, which is challenging as training must balance optimality and feasibility conditions. Supervised learning methods often approach this challenge by training the model on a large collection of pre-solved instances. This paper takes a different route and proposes the idea of Primal-Dual Learning (PDL), a self-supervised training method that does not require a set of pre-solved instances or an optimization solver for training and inference. Instead, PDL mimics the trajectory of an Augmented Lagrangian Method (ALM) and jointly trains primal and dual neural networks. Being a primal-dual method, PDL uses instance-specific penalties of the constraint terms in the loss function used to train the primal network. Experiments show that, on a set of nonlinear optimization benchmarks, PDL typically exhibits negligible constraint violations and minor optimality gaps, and is remarkably close to the ALM optimization. PDL also demonstrated improved or similar performance in terms of the optimality gaps, constraint violations, and training times compared to existing approaches.
研究动机与目标
- 为解决监督学习在约束优化中的局限性,即需要昂贵的预先求解实例生成,且常因约束惩罚的聚合而无法保证可行性。
- 开发一种自监督替代方法,绕过训练和推理过程中对预先求解训练数据及优化求解器的需求。
- 通过联合原始-对偶网络训练方案,实现基于实例的约束乘子,从而提升解的质量。
- 证明自监督原始-对偶学习可实现与增广拉格朗日法(ALM)相当的最优性差距和约束违反水平,ALM是标准优化求解器。
- 探索对偶网络近似在下游任务(如价格估计或求解器热启动)中的潜力。
提出的方法
- PDL提出一种自监督学习目标,模仿增广拉格朗日法(ALM)的迭代轨迹,同步训练原始和对偶神经网络。
- 该方法在原始损失函数中使用基于实例的对偶变量(乘子),以惩罚约束违反,从而实现动态且自适应的可行性保障。
- 原始网络预测决策变量,对偶网络估计拉格朗日乘子,两者通过迭代方式更新,以收敛至真实的原始和对偶解。
- 训练过程无需访问预先求解的实例或优化求解器;相反,它仅依赖于ALM的动力学和问题的数学公式。
- 该框架具有通用性,支持多种神经网络架构,包括用于可行性恢复的隐式层。
- PDL应用于凸和非凸二次规划、QCQP以及AC-OPF问题,通过最优性差距和约束违反指标评估性能。
实验结果
研究问题
- RQ1自监督方法能否消除在约束优化输入-输出映射学习中对预先求解训练实例的需求?
- RQ2具有基于实例的乘子的原始-对偶学习框架能否在可行性与最优性方面优于现有的监督方法和仅原始的自监督方法?
- RQ3PDL在解的质量和约束违反方面与增广拉格朗日法(ALM)相比如何?
- RQ4PDL的训练效率相对于监督基线方法如何,特别是在需要大量数据生成的问题中?
- RQ5PDL中获得的对偶网络近似能否支持下游应用,如价格估计或优化求解器的热启动?
主要发现
- 在凸和非凸QP问题中,PDL实现了0.03(0.01)的最优性差距和0.08(0.02)的最大约束违反,表明可行性极低且精度高。
- 在AC-OPF问题(case56和case118)中,PDL实现了0.37(0.52)的最优性差距和0.03(0.01)的最大约束违反,优于监督惩罚和拉格朗日松弛基线方法。
- 在QCQP问题中,PDL实现了0.05(0.01)的最优性差距和0.02(0.00)的约束违反,表现出极小误差的强劲性能。
- PDL的训练时间与监督基线LD相当(例如,QCQP中分别为5553.2秒和3572.3秒),同时避免了监督方法所需的715小时数据生成成本。
- 在AC-OPF case118中,PDL训练耗时7605.1秒,而监督基线的数据生成耗时达13,120.3秒,凸显了PDL在数据稀缺环境下的高效性。
- PDL的解与ALM极为接近,所有基准测试中,最优性差距和约束违反均持续低于或与现有方法相当。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。