Skip to main content
QUICK REVIEW

[论文解读] Learning Compressed Transforms with Low Displacement Rank

Anna Thomas, Albert Gu|PubMed|Oct 4, 2018
Sparse and Compressive Sensing Techniques参考文献 49被引用 3
一句话总结

本文提出了一类新型的低秩位移秩(LDR)矩阵,其中位移算子和低秩残差均从数据中学习,从而在表达能力上超越了以往固定算子的LDR方法。该方法在全连接、卷积和循环神经网络中均实现了最先进的压缩效果与准确率,部分任务中甚至优于结构化基线方法和未结构化的全连接层,同时参数量减少了20多倍。

ABSTRACT

The low displacement rank (LDR) framework for structured matrices represents a matrix through two displacement operators and a low-rank residual. Existing use of LDR matrices in deep learning has applied fixed displacement operators encoding forms of shift invariance akin to convolutions. We introduce a rich class of LDR matrices with more general displacement operators, and explicitly learn over both the operators and the low-rank component. This class generalizes several previous constructions while preserving compression and efficient computation. We prove bounds on the VC dimension of multi-layer neural networks with structured weight matrices and show empirically that our compact parameterization can reduce the sample complexity of learning. When replacing weight layers in fully-connected, convolutional, and recurrent neural networks for image classification and language modeling tasks, our new classes exceed the accuracy of existing compression approaches, and on some tasks even outperform general unstructured layers while using more than 20X fewer parameters.

研究动机与目标

  • 为克服固定位移算子LDR矩阵在深度学习中的性能局限,通过端到端学习位移结构,实现改进。
  • 开发一种参数高效、结构化的矩阵类别,保持快速的矩阵-向量乘法与压缩能力,同时提升泛化性能。
  • 分析具有LDR权重重矩阵的神经网络的样本复杂度,表明尽管表达能力增强,模型仍能高效学习。
  • 通过实证验证,可学习LDR矩阵在准确率上优于现有结构化压缩方法,甚至优于未结构化全连接层,同时实现显著的参数减少。

提出的方法

  • 提出一类新型LDR矩阵,其中位移算子不再固定,而是在训练过程中显式学习,从而引入更广泛的结构归纳偏置。
  • 开发了高效的PyTorch兼容算法,实现准线性时间复杂度的矩阵-向量乘法,利用快速结构化矩阵运算。
  • 使用LDR框架通过两个稀疏位移算子和一个低秩残差来表示矩阵,其中算子现为可训练参数。
  • 将LDR结构应用于全连接、卷积和循环层,用可学习的结构化替代品取代标准权重重矩阵。
  • 利用LDR矩阵的组合性质(例如,通道-wise 的托普利茨型矩阵可组合成更大的结构化矩阵),在各层间保持效率。
  • 采用一种参数化方法,将参数数量从O(n²)降低至O(n),在不损失模型容量的前提下实现高阶压缩。

实验结果

研究问题

  • RQ1在深度神经网络中,学习LDR矩阵的位移算子是否能带来优于固定算子的泛化性能与性能表现?
  • RQ2具有可学习LDR权重矩阵的神经网络的样本复杂度,与未结构化及先前研究的结构化矩阵相比如何?
  • RQ3可学习LDR矩阵是否能在保持显著参数减少的同时,优于现有结构化压缩方法和未结构化全连接层的准确率?
  • RQ4具有LDR权重矩阵的神经网络的理论容量如何?尽管表达能力增强,其是否仍能高效学习?
  • RQ5与卷积或低秩基线相比,LDR矩阵在建模复杂、非平移不变数据结构方面的能力如何?

主要发现

  • 在图像分类任务中,所提出的可学习LDR矩阵优于现有结构化压缩方法,并在多个基准测试(包括MNIST-bg-rot和CIFAR-10)中达到高于未结构化全连接层的准确率。
  • 与标准全连接层相比,该方法将参数量减少20倍以上,同时在全连接、卷积和循环架构中保持或提升了测试准确率。
  • 在Wikitext-2语言建模任务中,基于LDR的LSTM实现了具有竞争力的性能,且参数显著减少,证明了其在序列建模中的有效性。
  • 理论分析表明,具有LDR权重矩阵的多层网络的VC维随参数数量呈准线性增长,表明该模型类仍能从数据中高效学习。
  • 实证结果证实,与未结构化权重相比,使用所提出的LDR参数化可降低学习的样本复杂度,支持其泛化优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。