Skip to main content
QUICK REVIEW

[论文解读] Learning to Optimize Under Constraints with Unsupervised Deep Neural Networks

Seyedrazieh Bayati, Faramarz Jabbarvaziri|arXiv (Cornell University)|Jan 3, 2021
Manufacturing Process and Optimization被引用 4
一句话总结

本文提出了一种新颖的无监督深度学习框架,通过训练深度神经网络将问题参数映射到近似最优解,同时利用分段正则化方法强制执行通用等式与不等式约束,从而实现实时约束优化。该方法在显著降低在线推理成本的同时,实现了接近最优的可行性与与内点法相当的性能。

ABSTRACT

In this paper, we propose a machine learning (ML) method to learn how to solve a generic constrained continuous optimization problem. To the best of our knowledge, the generic methods that learn to optimize, focus on unconstrained optimization problems and those dealing with constrained problems are not easy-to-generalize. This approach is quite useful in optimization tasks where the problem's parameters constantly change and require resolving the optimization task per parameter update. In such problems, the computational complexity of optimization algorithms such as gradient descent or interior point method preclude near-optimal designs in real-time applications. In this paper, we propose an unsupervised deep learning (DL) solution for solving constrained optimization problems in real-time by relegating the main computation load to offline training phase. This paper's main contribution is proposing a method for enforcing the equality and inequality constraints to the DL-generated solutions for generic optimization tasks.

研究动机与目标

  • 弥合现有“学习优化”方法仅关注无约束问题的空白,特别是在需要频繁重新优化的动态环境中。
  • 开发一种通用的、可微分的方法,以在基于深度神经网络的连续优化中强制执行等式与不等式约束。
  • 实现在传统方法(如内点法)因计算复杂度高而过慢的优化任务中的实时推理。
  • 确保深度学习模型生成的解是可行的,而无需依赖事后归一化或启发式约束处理。

提出的方法

  • 将优化问题表述为从输入参数 $ p $ 到最优解 $ x^* $ 的深度神经网络(DNN)映射,损失函数设为目标函数 $ f_0(x;p) $。
  • 分别引入用于不等式和等式约束的分段正则化惩罚 $ ´\boldsymbol{\text{F}}_i(x^*;p) $ 和 $ ´\boldsymbol{\text{H}}_j(x^*;p) $,采用基于幂次的惩罚,指数为 $ ´\boldsymbol{\text{γ}} \geq 1 $,缩放因子为 $ \boldsymbol{\eta}_i \geq 0 $。
  • 用连续且可微分的惩罚函数替代非可微的指示函数 $ \mathbb{I}(\cdot) $,对约束违反情况施加递增的惩罚成本。
  • 使用随机优化(如ADAM)训练DNN,以最小化组合损失:$ \mathcal{L} = f_0(x^*;p) + \sum_i F_i(x^*;p) + \sum_j H_j(x^*;p) $,确保梯度可传播至可行与不可行区域。
  • 使用大量($ \sim 1000 $)均匀分布在参数空间中的训练样本,以实现对多样化问题设置的泛化。
  • 在训练过程中隐式强制执行约束,避免事后处理或使用如饱和激活等架构约束。

实验结果

研究问题

  • RQ1能否以可微、无监督的方式训练深度神经网络,使其学习从问题参数到满足通用等式与不等式约束的最优解的映射?
  • RQ2如何对约束违反进行惩罚,以支持基于梯度的优化,同时确保最终解的可行性?
  • RQ3基于DNN的解决方案在约束优化中能达到多接近最优的性能,与传统内点法相比如何?
  • RQ4所提出的方法在具有不同参数配置的多样化、非线性且非凸的优化景观中是否具备泛化能力?

主要发现

  • 对于带有一个约束的Rosenbrock函数,DNN生成的解与内点法结果高度一致:当 $ c_1=1, c_2=1 $ 时,DNN得到 $ x_1=0.8394, x_2=0.6040 $,而内点法结果为 $ 0.8082, 0.5889 $。
  • 对于带有三个约束的Rosenbrock函数,DNN即使在全局最小值位于可行集外部时,仍成功生成了可行解。
  • 在带有一个约束的Ackley函数中,DNN生成的解与最优解的差距在 $ 10^{-5} $ 以内(例如,$ x_1 = -5.6177 \times 10^{-6}, x_2 = 7.2256 \times 10^{-5} $),而内点法结果约为 $ \sim 10^{-12} $,表明具有高精度。
  • 通过在训练过程中施加引导网络向可行区域演化的惩罚项,该方法在所有测试案例中均保持了可行性,包括复杂的非线性约束。
  • 使用DNN进行推理的计算成本显著低于内点法,后者具有最坏情况复杂度 $ \mathcal{O}(\max\{n,m\}^4\sqrt{n}\log(1/\epsilon)) $,从而实现了实时部署。
  • 当 $ \eta_i = 10^8 $ 且 $ \gamma = 2 $ 时,惩罚项有效抑制了不可行解,确保仅学习到可行且近似最优的输出。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。