Skip to main content
QUICK REVIEW

[论文解读] Learning Low-Rank Approximation for CNNs

Dongsoo Lee, Se Jung Kwon|arXiv (Cornell University)|May 24, 2019
Sparse and Compressive Sensing Techniques参考文献 24被引用 13
一句话总结

本文提出 DeepTwist,一种新颖的训练技术,通过在不改变原始模型结构的前提下,在训练过程中注入低秩近似引起的噪声,实现对卷积神经网络(CNNs)的高精度低秩近似压缩。通过保持原始架构,该方法可实现高效的二维奇异值分解(SVD),并优于传统微调方法,尤其在高压缩比下表现更优;在 CIFAR-10 和 ImageNet 基准测试中,DeepTwist 下的分块 SVD 表现优于 Tucker 分解。

ABSTRACT

Low-rank approximation is an effective model compression technique to not only reduce parameter storage requirements, but to also reduce computations. For convolutional neural networks (CNNs), however, well-known low-rank approximation methods, such as Tucker or CP decomposition, result in degraded model accuracy because decomposed layers hinder training convergence. In this paper, we propose a new training technique that finds a flat minimum in the view of low-rank approximation without a decomposed structure during training. By preserving the original model structure, 2-dimensional low-rank approximation demanding lowering (such as im2col) is available in our proposed scheme. We show that CNN models can be compressed by low-rank approximation with much higher compression ratio than conventional training methods while maintaining or even enhancing model accuracy. We also discuss various 2-dimensional low-rank approximation techniques for CNNs.

研究动机与目标

  • 解决使用 Tucker 或 CP 分解等传统分解方法对卷积神经网络(CNNs)进行低秩近似时导致的模型精度下降问题。
  • 通过在训练过程中保持原始模型结构,实现在 CNNs 上有效执行二维低秩近似(如 SVD)。
  • 开发一种训练策略,以寻找对低秩近似引起的参数误差具有鲁棒性的平坦极小值。
  • 通过结合 im2col 降低(lowering)与基于 SVD 的低秩近似,提升压缩效率与精度。
  • 证明基于 SVD 的方法在 DeepTwist 训练下,可在精度与压缩比上超越 Tucker 分解。

提出的方法

  • DeepTwist 在固定间隔(每 $S_D$ 个批次)周期性地通过低秩近似(如 SVD)对网络权重进行扰动,注入噪声而不改变模型结构。
  • 该方法在整个训练过程中保持原始 CNN 架构,从而与基于 im2col 的降低技术兼容,实现二维 SVD。
  • 在扰动步骤中对权重张量应用低秩近似,通过分解张量的乘积重建,以模拟参数误差。
  • 当损失曲面相对于近似误差不够平坦时,通过扰动权重使训练过程逃离尖锐极小值。
  • 采用分块 SVD,固定块大小(如 64×64),每个块独立分解为秩 $r$,实现可扩展且高效的低秩近似。
  • 该方法避免了对分解后结构进行微调的需要,使转换后的模型可在训练后直接部署。

实验结果

研究问题

  • RQ1能否在保持或提升模型精度的前提下,对 CNNs 实现高比例压缩的低秩近似?
  • RQ2为何传统低秩方法(如 Tucker 或 CP 分解)即使经过微调,仍会导致模型精度下降?
  • RQ3在训练过程中注入低秩近似噪声,是否有助于找到对参数近似误差具有鲁棒性的平坦极小值?
  • RQ4保持原始模型结构是否能有效支持通过 im2col 变换在 CNNs 中使用二维 SVD?
  • RQ5与传统微调方法相比,DeepTwist 在使用 SVD 与 Tucker 分解时,其精度与压缩效率表现如何?

主要发现

  • 在 VGG19(CIFAR-10)上,DeepTwist 辅助的分块 SVD 实现了 4.00× 压缩比,top-1 准确率达 92.07%,优于相似压缩比下的 Tucker 分解。
  • 在 VGG19 上,DeepTwist 辅助的分块 SVD 在 2.00× 压缩比下保持 92.42% 的准确率,超过预训练模型的 92.37% 准确率。
  • 在 ResNet-34(ImageNet)上,DeepTwist 的分块 SVD 实现 3.1× 压缩比下 73.00% 的 top-1 准确率,优于 Tucker 分解的 72.31%。
  • 该方法通过保持原始模型结构,使 CNNs 中有效使用基于 im2col 的二维 SVD 成为可能。
  • 与传统微调方法相比,DeepTwist 在低秩近似训练过程中持续提升训练损失与测试准确率。
  • 扰动间隔 $S_D$ 和块大小的选择对最终准确率影响极小,表明方法具有鲁棒性且易于部署。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。