Skip to main content
QUICK REVIEW

[论文解读] On Energy-Based Models with Overparametrized Shallow Neural Networks

Carles Domingo-Enrich, Alberto Bietti|arXiv (Cornell University)|Apr 15, 2021
Model Reduction and Neural Networks参考文献 50被引用 4
一句话总结

本文研究了使用过参数化浅层神经网络的能量模型(EBMs),表明在“活跃”或“平均场”训练 regime 下,模型对低维数据结构的适应能力优于“懒惰”或核函数 regime。关键贡献在于,采用变分范数函数类($\mathcal{F}_1$)的能量模型实现了与内在维度而非环境维度相关的泛化率,从而打破了结构化数据的维度灾难。

ABSTRACT

Energy-based models (EBMs) are a simple yet powerful framework for generative modeling. They are based on a trainable energy function which defines an associated Gibbs measure, and they can be trained and sampled from via well-established statistical tools, such as MCMC. Neural networks may be used as energy function approximators, providing both a rich class of expressive models as well as a flexible device to incorporate data structure. In this work we focus on shallow neural networks. Building from the incipient theory of overparametrized neural networks, we show that models trained in the so-called "active" regime provide a statistical advantage over their associated "lazy" or kernel regime, leading to improved adaptivity to hidden low-dimensional structure in the data distribution, as already observed in supervised learning. Our study covers both maximum likelihood and Stein Discrepancy estimators, and we validate our theoretical results with numerical experiments on synthetic data.

研究动机与目标

  • 理解使用过参数化浅层神经网络训练的能量模型(EBMs)的统计与优化行为。
  • 比较 EBMs 在“活跃”(平均场)regime 与“懒惰”(核函数)regime 下学习结构化数据分布的性能。
  • 为使用变分范数空间($\mathcal{F}_1$)的能量模型建立泛化界,其依赖于内在维度而非环境维度。
  • 通过在具有低维结构的合成数据上的数值实验验证理论发现。

提出的方法

  • 利用过参数化神经网络的理论,分析 EBMs 在无限宽度极限下的优化与泛化行为。
  • 应用 Fenchel 对偶与变分法,推导学习问题的对偶形式,将原始能量函数与其对偶测度联系起来。
  • 考虑两种训练目标:通过 MCMC 实现的最大似然估计与通过梯度下降优化的 Stein 散度最小化。
  • 分析 $\mathcal{F}_1$ 空间(变分范数)中能量函数的行为,并与 $\mathcal{F}_2$ 空间(再生核希尔伯特空间)进行比较,表明 $\mathcal{F}_1$ 对低维结构具有更优的适应性。
  • 以 KL 散度与 Stein 散度为度量,推导出泛化界,显示其依赖于内在维度 $d^*$ 而非环境维度 $d$。
  • 采用平均场缩放方法,对宽浅层网络的动力学进行建模,从而实现对活跃 regime 下特征学习的分析。

实验结果

研究问题

  • RQ1在过参数化浅层网络的活跃 regime 下训练 EBM 是否能为结构化数据带来优于懒惰 regime 的泛化性能?
  • RQ2变分范数空间($\mathcal{F}_1$)能否通过适应低维数据结构,在 EBM 中打破维度灾难?
  • RQ3通过最大似然或 Stein 散度训练的 EBM 的泛化界如何依赖于数据的内在维度?
  • RQ4$\mathcal{F}_1$ 函数类在实现对结构化能量函数高效逼近方面起到什么作用?
  • RQ5在 EBM 背景下,$\mathcal{F}_1$ 的理论保证与基于 RKHS 的 $\mathcal{F}_2$ 类相比如何?

主要发现

  • 在活跃 regime 下训练的 EBM 的泛化界依赖于数据的内在维度 $d^*$ 而非环境维度 $d$,从而打破了维度灾难。
  • $\mathcal{F}_1$ 函数类能够高效逼近具有低维结构的能量函数,例如由局部相互作用或稀疏投影定义的函数。
  • 数值实验表明,基于 $\mathcal{F}_1$ 的 EBM 能够成功学习具有低维结构的合成分布,而基于 $\mathcal{F}_2$ 的模型则失败。
  • 活跃 regime 通过支持特征学习并改善对数据中隐藏低维流形的适应能力,为模型提供了统计优势。
  • 学习问题的变分形式中存在强对偶性,确保了最优解的存在,并通过神经网络能量函数刻画了所学习的吉布斯测度。
  • 活跃 regime 下学习到的能量函数形式为 $\frac{1}{Z_{\beta}}\exp\left(-\beta\int\sigma(\langle\theta,x\rangle)\,d\mu^\star(\theta)\right)$,将对偶测度 $\mu^\star$ 与最终模型联系起来。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。