Skip to main content
QUICK REVIEW

[论文解读] A representer theorem for deep neural networks

Michaël Unser|arXiv (Cornell University)|Feb 26, 2018
Sparse and Compressive Sensing Techniques参考文献 32被引用 5
一句话总结

本文通过使用二阶总变差对激活函数优化进行泛函正则化,提出了深度神经网络的表示定理。关键结果表明,最优网络使用具有自适应节点的非均匀线性样条,将深度学习与样条及稀疏性联系起来,并通过ℓ₁最小化显式促进稀疏性,统一了ReLU、PReLU、APL和MaxOut等架构的变分框架。

ABSTRACT

We propose to optimize the activation functions of a deep neural network by adding a corresponding functional regularization to the cost function. We justify the use of a second-order total-variation criterion. This allows us to derive a general representer theorem for deep neural networks that makes a direct connection with splines and sparsity. Specifically, we show that the optimal network configuration can be achieved with activation functions that are nonuniform linear splines with adaptive knots. The bottom line is that the action of each neuron is encoded by a spline whose parameters (including the number of knots) are optimized during the training procedure. The scheme results in a computational structure that is compatible with the existing deep-ReLU, parametric ReLU, APL (adaptive piecewise-linear) and MaxOut architectures. It also suggests novel optimization challenges, while making the link with $\ell_1$ minimization and sparsity-promoting techniques explicit.

研究动机与目标

  • 通过受核方法和正则化理论启发的变分原理,统一深度神经网络的设计与训练。
  • 通过在激活函数上引入泛函正则化,缓解模型通用性与参数简洁性之间的张力。
  • 建立深度神经网络与样条及稀疏性之间理论基础,特别是通过ℓ₁最小化。
  • 在单一数学框架下推广现有架构(如ReLU、MaxOut、APL),同时优化网络结构与参数。
  • 提供一个表示定理,保证最优解位于具有自适应节点的稀疏样条函数空间中。

提出的方法

  • 将深度学习问题表述为在具有二阶总变差正则化的函数空间上的泛函最小化问题。
  • 引入样条可适配的微分算子L = D²(二阶导数),定义正则化空间,从而导出分段线性激活函数。
  • 应用巴拿赫空间中广义插值的表示定理,表明极值解为具有自适应节点的非均匀线性样条。
  • 推导出最优网络配置对应于形如s(x) = Σbₙpₙ(x) + Σaₖρₗ(x−τₖ)的激活函数,其中ρₗ为算子L的格林函数。
  • 建立采样泛函(δ(x−xₘ))在有界变差函数空间BV⁽²⁾(ℝ)上的弱*-连续性,确保优化问题的适定性。
  • 证明正则化范数∥Lf∥ₘ等于样条系数的ℓ₁-范数∥a∥₁,直接关联到促进稀疏性的优化。

实验结果

研究问题

  • RQ1能否开发一个统一的变分框架,以联合优化深度神经网络的架构与参数?
  • RQ2深度神经网络是否存在一个表示定理,能够以样条形式表征最优激活函数?
  • RQ3二阶总变差正则化是否能导致稀疏且自适应的激活函数,从而实现良好泛化?
  • RQ4所提出的框架如何在单一数学原理下统一ReLU、PReLU、APL和MaxOut等现有架构?
  • RQ5该正则化框架在多大程度上促进稀疏性,并与深度学习中的ℓ₁最小化相联系?

主要发现

  • 在二阶总变差正则化下,最优深度神经网络配置为具有自适应节点的非均匀线性样条,其中每个神经元的激活函数为具有优化节点位置的分段线性函数。
  • 正则化范数∥Lf∥ₘ等于样条系数的ℓ₁-范数∥a∥₁,明确将优化与促进稀疏性的ℓ₁最小化联系起来。
  • 解空间由有限组基函数和狄拉克δ函数类的格林函数张成,确保最优网络在激活函数参数上具有稀疏表示。
  • 该框架与现有深度学习架构(如ReLU、PReLU、APL和MaxOut)兼容,因为这些架构可视为所提出的基于样条的激活函数的特例。
  • 采样泛函f ↦ f(xₘ)在BV⁽²⁾(ℝ)上弱*-连续,确保插值问题的适定性及唯一解的存在性。
  • 二阶导数算子D²的零空间由仿射函数(1, x)张成,只要数据点不全相同,即可保证插值问题的适定性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。