Skip to main content
QUICK REVIEW

[论文解读] Tensor Regression Networks with various Low-Rank Tensor Approximations

Xingwei Cao, Guillaume Rabusseau|arXiv (Cornell University)|Dec 27, 2017
Tensor decomposition and applications参考文献 14被引用 17
一句话总结

本文提出张量回归网络(TRN),采用低秩张量近似方法——CP、Tucker 和张量列车(TT)——对深度神经网络进行压缩,同时保持性能。实验表明,使用 TT 分解的 TRN 在 32 层 ResNet 上实现了 54 倍的压缩率,且在 CIFAR-10 上准确率下降不足 0.3%;出人意料的是,全局平均池化(GAP)在深层网络中表现优于 TRN,而使用 dropout 的 TRN 在浅层网络和数据有限的情况下表现更优。

ABSTRACT

Tensor regression networks achieve high compression rate of neural networks while having slight impact on performances. They do so by imposing low tensor rank structure on the weight matrices of fully connected layers. In recent years, tensor regression networks have been investigated from the perspective of their compressive power, however, the regularization effect of enforcing low-rank tensor structure has not been investigated enough. We study tensor regression networks using various low-rank tensor approximations, aiming to compare the compressive and regularization power of different low-rank constraints. We evaluate the compressive and regularization performances of the proposed model with both deep and shallow convolutional neural networks. The outcome of our experiment suggests the superiority of Global Average Pooling Layer over Tensor Regression Layer when applied to deep convolutional neural network with CIFAR-10 dataset. On the contrary, shallow convolutional neural networks with tensor regression layer and dropout achieved lower test error than both Global Average Pooling and fully-connected layer with dropout function when trained with a small number of samples.

研究动机与目标

  • 研究低秩张量近似在神经网络中的正则化与压缩能力。
  • 比较使用 CP、Tucker 和张量列车(TT)分解的张量回归层(TRL)的性能。
  • 在小样本场景下,评估 TRL 作为正则化器在浅层卷积神经网络中的有效性。
  • 确定 TRL 是否能在压缩与泛化能力方面超越标准层(如全局平均池化(GAP)和全连接层)。
  • 分析张量秩参数对基于 TRL 模型的表达能力与性能的影响。

提出的方法

  • 用张量回归层(TRL)替代卷积神经网络中的最后全连接层及展平操作,该层对权重张量施加低秩结构。
  • 应用三种低秩张量分解格式——CP、Tucker 和张量列车(TT)——来参数化 TRL 中的权重张量。
  • 基于张量代数与多线性回归原理,推导每种 TRL 变体的学习过程。
  • 采用早停法、dropout(正则化率分别为 0.3、0.5、0.7)以及 L2 正则化(正则化因子为 0.01、0.001、0.0001)以评估正则化效果。
  • 使用标准卷积神经网络架构:MNIST 使用两层卷积,CIFAR-10 和 SVHN 使用三层卷积,且在最后一层卷积后添加 dropout。
  • 通过比较不同训练集大小(100 至 15,000 个样本)下的模型性能,评估在数据稀缺条件下的泛化能力。

实验结果

研究问题

  • RQ1不同低秩张量近似方法(CP、Tucker、TT)在模型压缩与泛化性能方面如何比较?
  • RQ2在小样本场景下,对全连接层施加低秩张量结构是否能作为有效的正则化手段?
  • RQ3在深层与浅层网络中,TRL 的性能与全局平均池化(GAP)及带 dropout 的全连接层相比如何?
  • RQ4张量秩参数对基于 TRL 模型的表达能力与性能有何影响?
  • RQ5TRL 是否能在 CIFAR-10 和 MNIST 等标准基准上实现高倍压缩率,同时保持显著的准确率损失?

主要发现

  • 在 32 层 ResNet 上,TRL 中的张量列车(TT)分解实现了 54 倍压缩率,且在 CIFAR-10 上准确率仅下降 0.3%。
  • 在 CIFAR-10 的深层网络中,全局平均池化(GAP)表现优于 TRL,其准确率与压缩率均优于使用 TT 或 Tucker 分解的 TRL。
  • 在小样本数据集(如 100–2,000 个样本)上训练的浅层卷积神经网络中,带 dropout 的 TRL 表现优于 GAP 和带 dropout 的全连接层,测试误差更低。
  • 在小样本场景下,Tucker-和 TT-TRL 搭配 dropout 的方法,其测试准确率优于全连接层搭配 dropout,表明具有显著的正则化效果。
  • 在 MNIST 和 CIFAR-10 上,CP、Tucker 和 TT 分解的 TRL 性能相近,各类方法之间未观察到显著的准确率差异。
  • GAP 被证明是 TRL 在特定秩约束下使用 Tucker 分解的特例,为理解其等价性提供了理论依据。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。