Skip to main content
QUICK REVIEW

[论文解读] End-to-end Learning of a Convolutional Neural Network via Deep Tensor Decomposition

Samet Oymak, Mahdi Soltanolkotabi|arXiv (Cornell University)|May 16, 2018
Tensor decomposition and applications被引用 8
一句话总结

该论文提出深度张量分解(Deep Tensor Decomposition, DeepTD),一种新颖的端到端方法,通过训练数据的秩-1张量分解来学习卷积神经网络(CNN)权重。当样本量超过参数总数时,该方法可证明地恢复出植入的卷积核(至多符号和尺度的歧义),在可实现模型下建立了数据效率与理论保证,适用于深度CNN训练。

ABSTRACT

In this paper we study the problem of learning the weights of a deep convolutional neural network. We consider a network where convolutions are carried out over non-overlapping patches with a single kernel in each layer. We develop an algorithm for simultaneously learning all the kernels from the training data. Our approach dubbed Deep Tensor Decomposition (DeepTD) is based on a rank-1 tensor decomposition. We theoretically investigate DeepTD under a realizable model for the training data where the inputs are chosen i.i.d. from a Gaussian distribution and the labels are generated according to planted convolutional kernels. We show that DeepTD is data-efficient and provably works as soon as the sample size exceeds the total number of convolutional weights in the network. We carry out a variety of numerical experiments to investigate the effectiveness of DeepTD and verify our theoretical findings.

研究动机与目标

  • 开发一种理论基础坚实的端到端算法,用于在不依赖迭代优化的情况下学习深度CNN权重。
  • 解决尽管深度过参数化CNN在实践中表现成功,但其训练缺乏严格理论基础的问题。
  • 在具有高斯输入和植入卷积核的可实现模型下,建立学习CNN的数据效率与样本复杂度边界。
  • 将张量分解技术与深度学习相连接,为深度网络的初始化与理论分析提供新途径。

提出的方法

  • 从训练数据的特征和标签构建高阶张量,利用非重叠卷积的结构特性。
  • 利用在可实现模型下,总体张量近似为秩-1的性质,其因子编码了卷积核方向。
  • 使用经验张量逼近方法,从有限数据中估计秩-1结构,且误差随样本量增加而衰减。
  • 应用张量分解算法,从经验张量中提取卷积核方向,实现CNN权重的端到端恢复。
  • 建立理论边界,表明当样本数量超过参数总数时,即可实现卷积核恢复。
  • 通过利用秩-1结构与集中不等式,处理卷积核恢复中的符号与尺度歧义。

实验结果

研究问题

  • RQ1我们能否仅使用训练数据,在不依赖基于梯度的优化的情况下,以可证明的方式端到端学习深度CNN的权重?
  • RQ2在可实现模型下,成功恢复深度CNN中卷积核所需的最少训练样本数量是多少?
  • RQ3从有限数据构建的经验张量如何逼近总体张量?这种逼近随数据量增加如何改善?
  • RQ4尽管深度和非线性,张量分解技术在深度非线性架构(如CNN)中可应用到何种程度?
  • RQ5能否利用数据张量的秩-1结构来初始化或指导实际CNN训练中的随机梯度下降?

主要发现

  • 当训练样本数量超过网络中总参数数时,DeepTD可证明地恢复卷积核方向(至多符号和尺度的歧义)。
  • 经验张量与总体张量之间的差距随样本量增加而减小,当样本量与参数数量成比例时,该差距可忽略不计。
  • 该算法实现了数据效率,仅需样本量与参数数量同阶即可实现成功恢复。
  • 理论分析表明,当样本量满足涉及参数数量与网络深度的条件时,学习模型的泛化误差以高概率有界。
  • 函数类的覆盖数有界,使得可使用集中不等式推导出一致收敛与泛化边界。
  • 实验结果验证了理论发现,展示了在各种网络深度与架构下均能有效实现卷积核恢复,并具备鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。