Skip to main content
QUICK REVIEW

[论文解读] Computational Separation Between Convolutional and Fully-Connected Networks

Eran Malach, Shai Shalev‐Shwartz|arXiv (Cornell University)|Oct 3, 2020
Advanced Neural Network Applications参考文献 35被引用 11
一句话总结

本文通过证明卷积神经网络(CNNs)能够利用梯度下降高效学习具有强局部结构的函数——具体而言,是依赖于少量连续输入位的函数——而多项式大小的全连接网络(FCNs)则无法做到这一点,从而建立了CNNs与FCNs之间的计算分离。关键结果是,理论证明了CNNs因其对局部性的归纳偏置而具有计算优势,而非仅因参数效率或权重重用。

ABSTRACT

Convolutional neural networks (CNN) exhibit unmatched performance in a multitude of computer vision tasks. However, the advantage of using convolutional networks over fully-connected networks is not understood from a theoretical perspective. In this work, we show how convolutional networks can leverage locality in the data, and thus achieve a computational advantage over fully-connected networks. Specifically, we show a class of problems that can be efficiently solved using convolutional networks trained with gradient-descent, but at the same time is hard to learn using a polynomial-size fully-connected network.

研究动机与目标

  • 从理论上解释为何卷积神经网络(CNNs)在计算机视觉任务中优于全连接网络(FCNs),尽管FCNs具有更强的表达能力。
  • 分离并证明数据结构中的局部性——特别是依赖于连续输入位的函数——是CNNs性能优越的主要原因。
  • 证明当两者均为多项式大小时,CNNs与FCNs在学习局部结构函数时存在计算差距。
  • 通过基于MNIST的序列任务(输入长度和局部结构配置各异)进行实证验证,以验证理论发现。

提出的方法

  • 引入一类称为k-patterns的函数,其输出仅依赖于输入的k个连续位,以建模强局部结构。
  • 证明多项式大小的CNN可利用梯度下降在多项式时间内学习(log n)-patterns。
  • 证明任何多项式大小的FCN均无法通过梯度下降学习(log n)-patterns,从而建立计算分离。
  • 利用置换不变性与正交基分解(通过Parseval恒等式)分析梯度动态与泛化误差。
  • 通过随机置换的分布性论证,限制输入位移对梯度更新的影响。
  • 在MNIST序列上进行实证评估,其中标签由中心或非连续数字的奇偶性决定,比较FCN、CNN与局部连接网络(LCNs)的表现。

实验结果

研究问题

  • RQ1能否在CNNs与FCNs之间建立计算分离,以解释CNNs在视觉任务中经验优越性的原因?
  • RQ2CNNs的优势是源于参数效率、权重重用,还是数据中对局部性的归纳偏置?
  • RQ3CNNs能否利用梯度下降高效学习具有强局部结构的函数(例如,依赖于连续输入位的函数),而FCNs则不能?
  • RQ4若破坏局部结构(例如,使用非连续位),CNNs相对于FCNs的性能优势是否会消失?

主要发现

  • 证明了计算分离:CNNs可利用梯度下降在多项式时间内学习(log n)-patterns,而多项式大小的FCNs无法做到。
  • 当学习局部模式时,FCNs的性能随输入长度增加而显著下降,在实验中n=19时达到随机水平准确率。
  • 当标签依赖于连续位时,CNNs与LCNs在输入长度增加时仍保持高准确率,证实了局部性的作用。
  • 当标签依赖于非连续数字(破坏局部性)时,对于小n值,FCNs表现优于CNNs与LCNs,表明在缺乏局部结构时优势消失。
  • 实证结果证实,CNNs的理论优势源于其对局部性的归纳偏置,而非权重重用或参数效率。
  • 理论分析表明,由于缺乏局部归纳偏置,即使在过参数化情况下,梯度下降也无法在FCNs中学习(log n)-patterns。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。