Skip to main content
QUICK REVIEW

[论文解读] Kolmogorov Width Decay and Poor Approximators in Machine Learning: Shallow Neural Networks, Random Feature Models and Neural Tangent Kernels

E Weinan, Stephan Wojtowytsch|arXiv (Cornell University)|May 21, 2020
Neural Networks and Applications参考文献 25被引用 6
一句话总结

本文建立了一个理论框架,将柯尔莫哥洛夫宽度衰减与机器学习中的逼近极限联系起来,表明浅层神经网络和随机特征模型在高维Lipschitz函数的$L^2$-范数下是表现较差的逼近器。研究证明,再生核希尔伯特空间(RKHS)和无限宽神经网络由于柯尔莫哥洛夫宽度衰减缓慢,会受到维度灾难的影响,而与两层网络相关的Barron空间在相同条件下可提供显著更优的逼近速率。

ABSTRACT

We establish a scale separation of Kolmogorov width type between subspaces of a given Banach space under the condition that a sequence of linear maps converges much faster on one of the subspaces. The general technique is then applied to show that reproducing kernel Hilbert spaces are poor $L^2$-approximators for the class of two-layer neural networks in high dimension, and that multi-layer networks with small path norm are poor approximators for certain Lipschitz functions, also in the $L^2$-topology.

研究动机与目标

  • 识别机器学习模型在高维空间中逼近能力的根本限制。
  • 解释尽管具有理论表达能力,为何随机特征模型和无限宽神经网络在Lipschitz函数上的表现仍不佳。
  • 基于柯尔莫哥洛夫宽度衰减,建立一个通用的抽象框架,用于比较不同函数空间的逼近速率。
  • 证明Barron空间(对应两层网络)和树状结构函数空间(对应深层网络)在高维$L^2$-逼近中优于RKHS和Lipschitz空间。

提出的方法

  • 推导一个抽象引理,将巴拿赫空间中两个子空间上线性算子的收敛速率与柯尔莫哥洛夫宽度的衰减速率联系起来。
  • 将该引理应用于比较Barron空间(两层网络)与Lipschitz空间的逼近性能,以及RKHS与Barron空间的逼近性能。
  • 使用类似蒙特卡洛的积分算子分析Barron空间和Lipschitz空间上的收敛性,表明Barron空间上的衰减更快。
  • 通过将投影作用于RKHS核的特征子空间,比较RKHS与Barron空间上的收敛性,揭示RKHS的衰减更慢。
  • 利用算子范数差值推导柯尔莫哥洛夫宽度衰减的定量下界:$\|A_n - A\|_{L(X,W)} \leq C_X n^{-\alpha}$ 与 $\|A_n - A\|_{L(Y,W)} \geq c_Y n^{-\beta}$,其中 $\beta < \alpha$。
  • 证明宽度衰减速率 $\rho(t) \gtrsim t^{-\beta/(α - \beta)}$,从而证明衰减缓慢意味着逼近性能差。

实验结果

研究问题

  • RQ1为何随机特征模型和无限宽神经网络在高维$L^2$下无法高效逼近Lipschitz函数?
  • RQ2与Barron空间相比,RKHS在高维下逼近性能差的根本原因是什么?
  • RQ3能否建立一个通用的理论框架,解释不同函数空间在机器学习模型中逼近差距的本质?
  • RQ4不同子空间上线性算子的收敛速率如何与柯尔莫哥洛夫宽度衰减及逼近质量相关联?

主要发现

  • 再生核希尔伯特空间(RKHS)在高维下对两层神经网络是表现较差的$L^2$-逼近器,其柯尔莫哥洛夫宽度以 $t^{-\beta/(α - \beta)}$ 的速率缓慢衰减。
  • 无限宽的随机特征模型和神经正切核(NTK)在逼近$[0,1]^d$上的通用Lipschitz函数时,会受到维度灾难的影响。
  • 本文证明了柯尔莫哥洛夫宽度衰减的一般下界:$\rho(t) \geq C \cdot t^{-\beta/(α - \beta)}$,其中 $t \geq c_Y/(2C_X)$,且 $\beta < \alpha$。
  • 具有有界Barron范数的两层网络可在$L^2$中实现比RKHS快得多的衰减速率,表明其具有更优的逼近能力。
  • 路径范数较小的多层网络在高维下对Lipschitz函数的逼近能力同样较差,证实了维度灾难的存在。
  • 神经正切核(NTK)和随机特征核具有相同的特征值衰减速率,意味着它们在高维下具有相似的逼近限制。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。