Skip to main content
QUICK REVIEW

[论文解读] Over Parameterized Two-level Neural Networks Can Learn Near Optimal Feature Representations

Cong Fang, Hanze Dong|arXiv (Cornell University)|Oct 25, 2019
Advanced Neural Network Applications参考文献 42被引用 11
一句话总结

本文提出了一种名为“神经特征重分布”(neural feature repopulation)的新理论框架,用以解释为何过参数化的两层神经网络能够学习到近似最优的特征表示。通过分析无限宽度极限下的情况,研究表明随机梯度下降会收敛到一个明确定义的、近乎最优的特征分布,且实证验证结果证实了该理论在真实数据集上的预测准确性。

ABSTRACT

Recently, over-parameterized neural networks have been extensively analyzed in the literature. However, the previous studies cannot satisfactorily explain why fully trained neural networks are successful in practice. In this paper, we present a new theoretical framework for analyzing over-parameterized neural networks which we call neural feature repopulation. Our analysis can satisfactorily explain the empirical success of two level neural networks that are trained by standard learning algorithms. Our key theoretical result is that in the limit of infinite number of hidden neurons, over-parameterized two-level neural networks trained via the standard (noisy) gradient descent learns a well-defined feature distribution (population), and the limiting feature distribution is nearly optimal for the underlying learning task under certain conditions. Empirical studies confirm that predictions of our theory are consistent with the results observed in real practice.

研究动机与目标

  • 为解决当前理论对过参数化神经网络在非凸优化景观下仍能成功的原因缺乏理解这一空白提供支持。
  • 解释两层神经网络如何通过标准训练算法学习到高质量、近似最优的特征表示。
  • 提出一种新的理论框架——神经特征重分布,将特征学习与线性分类分离,并显式引入正则化。
  • 证明过参数化网络的极限行为对应于对特征分布的凸优化问题。
  • 通过实证验证理论,展示其与真实世界数据集中观察到的训练动态和特征质量的一致性。

提出的方法

  • 将两层神经网络的无限宽度极限形式化为对特征分布的连续优化问题。
  • 引入一个群体层面的目标函数,对特征分布上的期望损失进行建模,从而支持凸分析。
  • 使用带噪声的梯度下降来优化特征分布,在较弱条件下证明其收敛到近似最优解。
  • 将正则化(如权重衰减)显式地整合进特征学习过程,将其与神经元的有效重要性联系起来。
  • 通过特征重分布实验进行实证验证——从学习到的分布中采样特征,并与随机或均匀采样进行性能比较。
  • 使用 t-SNE 和二维投影可视化学习到的特征,以证明其具有更好的类别可分性。

实验结果

研究问题

  • RQ1过参数化的两层神经网络在标准训练过程中如何学习特征表示?
  • RQ2为何这些网络学习到的特征对下游分类任务具有实用性?
  • RQ3宽网络的训练动态是否能通过特征分布上的极限凸优化问题来解释?
  • RQ4正则化在塑造有效特征分布和神经元重要性方面发挥何种作用?
  • RQ5关于特征重分布的理论预测在真实训练中的实证观察中有多大程度上成立?

主要发现

  • 在无限宽度极限下,通过(带噪声)梯度下降训练的过参数化两层神经网络会收敛到一个明确定义的、近乎最优的特征分布。
  • 理论分析表明,在无限宽度条件下,特征学习过程变为凸优化,从而可获得严格的收敛性保证。
  • 实证结果证实,从学习到的分布中采样得到的特征(即特征重分布)在训练损失和测试误差方面均优于随机或均匀采样得到的特征。
  • 基于神经元学习到的大小(如 ||u/m'||)进行重要性采样,其性能显著优于均匀采样,尤其是在强正则化条件下。
  • 使用学习到的权重分布进行特征初始化,相比标准的高斯初始化,能实现更快的收敛速度和更好的泛化性能。
  • 对第一层特征进行 t-SNE 和二维可视化显示,学习到的特征相比随机特征或仅通过优化得到的特征,具有更优的类别可分性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。