Skip to main content
QUICK REVIEW

[论文解读] An efficient nonconvex reformulation of stagewise convex optimization problems

Rudy Bunel, Oliver Hinder|arXiv (Cornell University)|Oct 27, 2020
Adversarial Robustness in Machine Learning参考文献 44被引用 4
一句话总结

本文提出了一种分阶段凸优化问题的非凸重参数化方法,将其转化为可通过投影梯度法求解的边界约束问题。该方法通过避免虚假局部极小值,实现了快速收敛和极小的对偶间隙,并保证全局最优性,在神经网络验证任务中优于通用求解器和专用求解器。

ABSTRACT

Convex optimization problems with staged structure appear in several contexts, including optimal control, verification of deep neural networks, and isotonic regression. Off-the-shelf solvers can solve these problems but may scale poorly. We develop a nonconvex reformulation designed to exploit this staged structure. Our reformulation has only simple bound constraints, enabling solution via projected gradient methods and their accelerated variants. The method automatically generates a sequence of primal and dual feasible solutions to the original convex problem, making optimality certification easy. We establish theoretical properties of the nonconvex formulation, showing that it is (almost) free of spurious local minima and has the same global optimum as the convex problem. We modify PGD to avoid spurious local minimizers so it always converges to the global minimizer. For neural network verification, our approach obtains small duality gaps in only a few gradient steps. Consequently, it can quickly solve large-scale verification problems faster than both off-the-shelf and specialized solvers.

研究动机与目标

  • 为解决通用求解器在大规模设置(如神经网络验证)中分阶段凸优化问题的可扩展性差的问题。
  • 开发一种非凸重参数化方法,保留原始凸问题的全局最优解,同时通过一阶方法实现高效求解。
  • 提供一种能自然生成原始和对偶可行迭代解的方法,通过监测对偶间隙简化最优性认证。
  • 设计一种算法,即使在重参数化问题具有非凸性的情况下,也能避免虚假局部极小值并收敛至全局最小解。
  • 在大规模神经网络验证基准上,显著提升现有求解器(包括DeepVerify和基于CVXPY的方法)的运行速度。

提出的方法

  • 将原始的分阶段凸问题重参数化为仅含简单边界约束的非凸问题,从而可使用投影梯度下降(PGD)求解。
  • 采用光滑的非凸重参数化形式,保持与原始凸问题相同的全局最优解,同时仅有少量虚假局部极小值。
  • 通过自适应线搜索和步长回溯改进PGD,避免收敛至虚假局部极小解。
  • 利用重参数化结构,同时生成原始和对偶可行的迭代解,实现对偶间隙的实时计算。
  • 采用带回溯线搜索的FISTA进行高效优化,并基于相对对偶间隙实现早期停止。
  • 利用Simple-Psi-Minimization原理指导非凸目标函数的优化。

实验结果

研究问题

  • RQ1分阶段凸问题的非凸重参数化是否能在保留全局最优解的同时,通过一阶方法实现更快收敛?
  • RQ2所提出的非凸形式是否具有有利的优化景观,即仅有少量或没有虚假局部极小值?
  • RQ3带有自适应线搜索的投影梯度法是否能在非凸性存在的情况下可靠收敛至全局最小解?
  • RQ4优化过程中对偶间隙如何演化?是否可有效用于早期停止?
  • RQ5该方法是否能在神经网络验证任务中超越通用求解器和专用求解器(如DeepVerify)?

主要发现

  • 非凸重参数化形式与原始凸问题具有相同的全局最优解,且几乎不存在虚假局部极小值。
  • 结合自适应线搜索的投影梯度下降法能收敛至全局最小解,避免陷入虚假局部解。
  • 在神经网络验证任务中,该方法平均在10次迭代内实现对偶间隙低于10^-2,实现快速且精确的边界估计。
  • 在CIFAR-10网络上,该方法相比DeepVerify最快提升100倍,相比基于CVXPY的求解器最快提升1000倍,尤其在中型和大型网络上优势显著。
  • 在IBP训练的网络上,该方法实现了98–100%的早期停止率,表明其在极少数步骤内即可实现可靠收敛。
  • 即使在退化或具有挑战性的激活函数(如SoftPlus)下,使用算法3的方法仍能成功找到最优解,而DeepVerify则无法收敛。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。