Skip to main content
QUICK REVIEW

[论文解读] Algorithms and SQ Lower Bounds for PAC Learning One-Hidden-Layer ReLU Networks

Ilias Diakonikolas, Daniel M. Kane|arXiv (Cornell University)|Jun 22, 2020
Machine Learning and Algorithms参考文献 30被引用 10
一句话总结

本文提出了首个在高斯边缘下针对具有正权重的一层ReLU网络的多项式时间PAC学习算法,在隐藏单元数最多为$\tilde{O}(\sqrt{\log d})$时实现了高效学习。此外,本文建立了具有任意实系数网络的统计查询(SQ)下界$d^{\Omega(k)}$,证明了在正系数与一般系数设置之间存在计算分离。

ABSTRACT

We study the problem of PAC learning one-hidden-layer ReLU networks with $k$ hidden units on $\mathbb{R}^d$ under Gaussian marginals in the presence of additive label noise. For the case of positive coefficients, we give the first polynomial-time algorithm for this learning problem for $k$ up to $ ilde{O}(\sqrt{\log d})$. Previously, no polynomial time algorithm was known, even for $k=3$. This answers an open question posed by~\cite{Kliv17}. Importantly, our algorithm does not require any assumptions about the rank of the weight matrix and its complexity is independent of its condition number. On the negative side, for the more general task of PAC learning one-hidden-layer ReLU networks with arbitrary real coefficients, we prove a Statistical Query lower bound of $d^{Ω(k)}$. Thus, we provide a separation between the two classes in terms of efficient learnability. Our upper and lower bounds are general, extending to broader families of activation functions.

研究动机与目标

  • 为在存在标签噪声的高斯分布下,填补一维ReLU网络可证明高效学习的空白。
  • 确定在对权重矩阵结构无任何假设的情况下,是否可以对具有任意实系数的ReLU网络实现高效PAC学习。
  • 建立ReLU网络在正系数与一般实系数之间可学习性的计算分离。
  • 将结果扩展至更广泛的激活函数族。

提出的方法

  • 基于矩估计和埃尔米特多项式展开,提出一种新颖的算法框架,用于在高斯边缘下学习正系数ReLU网络。
  • 采用统计查询(SQ)建模方法,通过分析函数在埃尔米特基下的旋转与对称操作行为,证明下界。
  • 利用激活函数的$k$-奇偶部分分解,刻画下界构造在何时产生非零分量。
  • 应用旋转算子$R_k$与带符号和算子$S_k$,检测函数空间中对SQ查询具有抗性的非平凡分量。
  • 利用埃尔米特展开与内积的性质,证明某些函数类无法通过SQ方法实现高效学习。
  • 证明对于ReLU和Sigmoid激活函数,在温和条件下$S_k\phi$算子非零,从而可构造困难实例。

实验结果

研究问题

  • RQ1是否存在一个在高斯边缘下针对具有正权重的一维ReLU网络的多项式时间PAC学习算法?
  • RQ2在相同分布假设下,能否对具有任意实系数的ReLU网络实现高效PAC学习?
  • RQ3学习具有通用系数的一维ReLU网络的统计查询复杂度是多少?
  • RQ4在相同框架下,ReLU网络的可学习性特性与其他激活函数相比如何?
  • RQ5能否通过SQ下界正式建立正系数与一般系数网络之间的计算差距?

主要发现

  • 本文提出了首个针对具有正系数的一维ReLU网络的多项式时间PAC学习算法,适用于$k = \tilde{O}(\sqrt{\log d})$个隐藏单元。
  • 该算法的复杂度与权重矩阵的条件数无关,且无需对权重矩阵的秩作任何假设。
  • 证明了对于具有任意实系数的网络,学习的统计查询下界为$d^{\Omega(k)}$,意味着当$k = \omega(1)$时,不存在高效的SQ算法。
  • 下界构造依赖于ReLU和Sigmoid激活函数的$S_k\phi$算子的非零性,该性质在激活函数的$k$-奇偶部分非低次多项式时成立。
  • 结果可推广至更广泛的激活函数族,表明正系数与一般系数之间的计算差距源于激活函数的谱特性。
  • 本工作在形式上建立了可学习性的分离:在相同分布假设下,正系数网络可高效学习,而一般系数网络则不可。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。