Skip to main content
QUICK REVIEW

[论文解读] Online Stochastic Gradient Descent with Arbitrary Initialization Solves Non-smooth, Non-convex Phase Retrieval

Tan Yan, Roman Vershynin|arXiv (Cornell University)|Oct 28, 2019
Advanced X-ray Imaging Techniques参考文献 32被引用 13
一句话总结

该论文证明了在仅使用 $\Omega(d\log d)$ 高斯测量的情况下,对于任意初始化,具有常数步长的在线随机梯度下降(SGD)可收敛至非光滑、非凸相位恢复问题的全局最小值。关键贡献在于提出了一种新颖的分析框架,结合概要状态空间与随机过程理论,实现了无需谱初始化的收敛性证明,这是迈向理论驱动的非凸优化(超越两阶段方法)的重要一步。

ABSTRACT

In recent literature, a general two step procedure has been formulated for solving the problem of phase retrieval. First, a spectral technique is used to obtain a constant-error initial estimate, following which, the estimate is refined to arbitrary precision by first-order optimization of a non-convex loss function. Numerical experiments, however, seem to suggest that simply running the iterative schemes from a random initialization may also lead to convergence, albeit at the cost of slightly higher sample complexity. In this paper, we prove that, in fact, constant step size online stochastic gradient descent (SGD) converges from arbitrary initializations for the non-smooth, non-convex amplitude squared loss objective. In this setting, online SGD is also equivalent to the randomized Kaczmarz algorithm from numerical analysis. Our analysis can easily be generalized to other single index models. It also makes use of new ideas from stochastic process theory, including the notion of a summary state space, which we believe will be of use for the broader field of non-convex optimization.

研究动机与目标

  • 通过证明在相位恢复问题中,无需谱初始化即可实现 SGD 的收敛性,填补非凸优化中的理论空白。
  • 建立常数步长在线 SGD 在非光滑幅值平方损失目标函数下收敛至全局最小值的理论基础。
  • 开发一种可推广的框架,用于利用随机过程与概要状态空间分析非凸、非光滑优化问题。
  • 探究一阶方法是否能够从任意初始化收敛,从而避免预处理步骤的需要。
  • 将 SGD 在非凸设置下的理论理解拓展至非凸类似景观或平滑目标函数之外的场景。

提出的方法

  • 分析在非光滑相位恢复目标函数 $f(\mathbf{x}) = \frac{1}{2N}\sum_{k=1}^N (|\langle\mathbf{a}^{(k)},\mathbf{x}\rangle| - b^{(k)})^2$ 上使用常数步长的在线 SGD。
  • 引入概要状态空间以追踪 SGD 过程的关键动力学,将高维状态演化简化为可管理的马尔可夫链。
  • 利用高斯采样向量的旋转对称性与 $1/d$ 步长缩放,证明在 $d \to \infty$ 的渐近条件下实现收敛。
  • 应用超鞅不等式与尾部概率界,控制偏离期望轨迹的概率。
  • 在估计接近解的区域,通过新颖的状态空间论证建立线性收敛性。
  • 将该框架推广至其他单指标模型,并推测其适用于低秩矩阵感知问题。

实验结果

研究问题

  • RQ1具有常数步长的在线 SGD 是否能从任意初始化收敛至非光滑、非凸相位恢复问题的全局最小值?
  • RQ2是否可能通过一阶方法消除相位恢复中对谱初始化的需求?
  • RQ3能否开发一种新颖的分析框架,以研究非光滑、非凸设置下 SGD 的收敛性?
  • RQ4概要状态空间方法如何捕捉高维非凸优化中 SGD 的本质动力学?
  • RQ5该框架是否可推广至相位恢复以外的其他单指标模型?

主要发现

  • 具有常数步长的在线 SGD 从任意初始化出发,可收敛至非光滑幅值平方损失目标函数的全局最小值。
  • 在使用 $\Omega(d\log d)$ 高斯测量的条件下,收敛性得以保证,其样本复杂度与最先进的两阶段方法相当。
  • 在最终阶段实现线性收敛,误差衰减速率为 $\left(1 - \frac{1}{2d}\right)^k$,在足够迭代次数后成立。
  • 成功概率至少为 $0.8 - C/\log d - 1/d$,随着维度 $d$ 增大,该值趋近于 0.8。
  • 基于概要状态空间的分析框架可推广至具有适当链接函数的其他单指标模型。
  • 该框架为通过多维状态追踪理解非凸优化提供了路径,并基于追踪变量的数量提供了一种复杂度度量。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。