Skip to main content
QUICK REVIEW

[论文解读] On the Approximation Properties of Random ReLU Features

Yitong Sun, Anna C. Gilbert|arXiv (Cornell University)|Oct 10, 2018
Machine Learning and ELM参考文献 17被引用 19
一句话总结

本文建立了由随机 ReLU 特征诱导的再生核希尔伯特空间(RKHS)的普遍性,证明其构成一种普遍一致的学习方法。此外,本文揭示了一种类深度分离现象:尽管浅层模型(包括随机 ReLU 特征)难以近似某些复合函数,但具有有界权重的深层 ReLU 网络却能高效近似这些函数,揭示了浅层随机特征模型的根本局限性。

ABSTRACT

We study the approximation properties of random ReLU features through their reproducing kernel Hilbert space (RKHS). We first prove a universality theorem for the RKHS induced by random features whose feature maps are of the form of nodes in neural networks. The universality result implies that the random ReLU features method is a universally consistent learning algorithm. We prove that despite the universality of the RKHS induced by the random ReLU features, composition of functions in it generates substantially more complicated functions that are harder to approximate than those functions simply in the RKHS. We also prove that such composite functions can be efficiently approximated by multi-layer ReLU networks with bounded weights. This depth separation result shows that the random ReLU features models suffer from the same weakness as that of shallow models. We show in experiments that the performance of random ReLU features is comparable to that of random Fourier features and, in general, has a lower computational cost. We also demonstrate that when the target function is the composite function as described in the depth separation theorem, 3-layer neural networks indeed outperform both random ReLU features and 2-layer neural networks.

研究动机与目标

  • 建立由随机 ReLU 特征诱导的 RKHS 的普遍性,确保其能够近似任意连续函数。
  • 分析随机 ReLU 特征在建模比 RKHS 内函数更复杂的复合函数时的近似局限性。
  • 证明具有有界权重的多层 ReLU 网络能够高效近似此类复合函数,凸显深度分离优势。
  • 通过实证验证,随机 ReLU 特征在计算上高效,且性能与随机傅里叶特征相当,但计算成本更低。
  • 证明三层 ReLU 网络在需要深度才能准确近似的目标函数上,优于两层网络和随机 ReLU 特征。

提出的方法

  • 利用泛函分析工具,在激活函数 σ 和参数分布的广泛充分条件下,证明由随机 ReLU 特征诱导的 RKHS 的普遍性。
  • 利用 Bach(2017b)的结果,将 Huang 等人(2006)关于有界特征映射的结果推广至无界但可接受的随机特征。
  • 构建一个具有有界权重的深层 ReLU 网络,以近似那些无法被浅层模型高效近似的复合函数。
  • 应用重缩放技术,在保持函数近似能力的同时,使中间层的权重保持有界,从而确保稳定性和泛化能力。
  • 使用带约束的最小化经验风险方法,以保证在随机 ReLU 特征空间中存在优良的近似器。
  • 在合成数据集上开展实验,比较随机 ReLU 特征与随机傅里叶特征的性能,数据集包括正弦、条带、方形和棋盘分布。

实验结果

研究问题

  • RQ1在何种条件下,由随机 ReLU 特征诱导的 RKHS 具有普遍性,从而确保能够近似任意连续函数?
  • RQ2随机 ReLU 特征能否高效近似那些比其 RKHS 内函数更复杂的复合函数?
  • RQ3具有有界权重的深层 ReLU 网络是否在近似此类复合函数方面优于浅层模型(包括随机 ReLU 特征)?
  • RQ4在准确性和计算成本方面,随机 ReLU 特征的性能与随机傅里叶特征相比如何?
  • RQ5在随机 ReLU 特征空间上进行经验风险最小化,能否保证良好的泛化能力和近似性能?

主要发现

  • 在激活函数和参数分布的广泛条件下,由随机 ReLU 特征诱导的 RKHS 具有普遍性,从而确保了学习方法的普遍一致性。
  • 尽管 RKHS 具有普遍性,但由 RKHS 元素复合而成的函数复杂度显著更高,且比 RKHS 内部的函数更难近似。
  • 具有有界权重的多层 ReLU 网络能够高效近似这些复合函数,展示了深度分离效应,即深层模型优于浅层模型。
  • 三层 ReLU 网络在基于深度分离定理构建的目标函数上,优于两层网络和随机 ReLU 特征,证实了深度的理论优势。
  • 随机 ReLU 特征在性能上可与随机傅里叶特征相媲美,但计算成本更低,尤其得益于 ReLU 的 0 或恒等输出导致的更稀疏特征向量。
  • 在合成数据集上的实证结果证实,随机 ReLU 特征有效且高效,且深度在复杂复合目标函数的近似中提供了决定性优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。