[论文解读] Implicit Convex Regularizers of CNN Architectures: Convex Optimization of Two- and Three-Layer Networks in Polynomial Time
本文提出了首个针对带有 ReLU 激活函数的两层和三层卷积神经网络(CNN)的多项式时间凸优化公式,利用半无限对偶性推导出等价的凸规划。研究揭示了网络结构选择(如池化类型和权重共享)会引入隐式的凸正则化项,包括 ℓ₁、ℓ₂ 和核范数,从而实现相对于数据规模、维度和神经元数量的多项式时间全局优化。
We study training of Convolutional Neural Networks (CNNs) with ReLU activations and introduce exact convex optimization formulations with a polynomial complexity with respect to the number of data samples, the number of neurons, and data dimension. More specifically, we develop a convex analytic framework utilizing semi-infinite duality to obtain equivalent convex optimization problems for several two- and three-layer CNN architectures. We first prove that two-layer CNNs can be globally optimized via an $\\ell_2$ norm regularized convex program. We then show that multi-layer circular CNN training problems with a single ReLU layer are equivalent to an $\\ell_1$ regularized convex program that encourages sparsity in the spectral domain. We also extend these results to three-layer CNNs with two ReLU layers. Furthermore, we present extensions of our approach to different pooling methods, which elucidates the implicit architectural bias as convex regularizers.
研究动机与目标
- 为解决带有 ReLU 激活函数的非凸 CNN 训练缺乏理论理解的问题。
- 开发适用于浅层 CNN 的全局最优训练方法,且计算上是可行的。
- 刻画如池化和权重共享等网络结构选择如何隐式正则化优化问题。
- 建立 CNN 网络结构与信号处理和压缩感知中已知凸正则化项之间的联系。
- 为带有 ReLU 单元的两层和三层 CNN 提供一个多项式时间训练框架。
提出的方法
- 利用半无限对偶性,推导出带有 ReLU 激活函数的两层和三层 CNN 的等价凸规划。
- 通过利用 ReLU 和卷积层的结构,将非凸训练问题转化为有限维凸规划。
- 应用拉格朗日对偶性和强对偶性,推导出多项式时间可解的对偶公式。
- 引入变量替换,将对偶问题表示为捕捉隐式正则化的新型变量。
- 推导出等价的凸规划,其正则化项根据网络结构对应 ℓ₁、ℓ₂ 或核范数。
- 分析了多种池化策略(最大池化、平均池化、展平)并表明其会诱导不同的凸正则化项。
实验结果
研究问题
- RQ1带有 ReLU 激活函数的两层和三层 CNN 是否能在多项式时间内实现全局优化?
- RQ2具有权重共享和池化的 ReLU CNN 网络结构会隐式施加何种凸正则化?
- RQ3不同的池化机制(如最大池化与平均池化)如何影响 CNN 中的隐式正则化?
- RQ4浅层 CNN 的训练能否被重新表述为具有已知正则化项的有限维凸优化问题?
- RQ5循环卷积和 ReLU 激活在塑造优化景观的隐式偏差中起什么作用?
主要发现
- 带有 ReLU 激活函数的两层 CNN 可通过 ℓ₂-范数正则化的凸规划实现全局优化。
- 具有单个 ReLU 层的多层循环 CNN 等价于一个在频谱域促进稀疏性的 ℓ₁-正则化凸规划。
- 具有两个 ReLU 层的三层 CNN 可通过带有隐式 ℓ₁-范数正则化的凸规划实现全局优化。
- 池化策略如最大池化和平均池化会诱导不同的凸正则化项,范围从 ℓ₁ 到核范数。
- 所提出的凸公式在数据样本数量、数据维度和神经元数量方面均为多项式时间可解。
- 该框架揭示了 CNN 中的网络结构选择会隐式施加已知的凸正则化项,将 CNN 训练与成熟的凸优化和信号处理理论联系起来。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。