Skip to main content
QUICK REVIEW

[论文解读] CAT: Compression-Aware Training for bandwidth reduction

Chaim Baskin, Brian Chmiel|arXiv (Cornell University)|Sep 25, 2019
Algorithms and Data Compression参考文献 40被引用 10
一句话总结

CAT(压缩感知训练)通过训练模型生成低熵特征图来减少卷积神经网络中的内存带宽,在推理过程中实现高效的熵编码。通过使用可微分损失项最小化激活熵,CAT 实现了高达 4 倍的内存带宽减少——例如,在 ResNet-34 上每数值仅需 1.79 位,且准确率仅下降 0.2%,无需硬件更改。

ABSTRACT

Convolutional neural networks (CNNs) have become the dominant neural network architecture for solving visual processing tasks. One of the major obstacles hindering the ubiquitous use of CNNs for inference is their relatively high memory bandwidth requirements, which can be a main energy consumer and throughput bottleneck in hardware accelerators. Accordingly, an efficient feature map compression method can result in substantial performance gains. Inspired by quantization-aware training approaches, we propose a compression-aware training (CAT) method that involves training the model in a way that allows better compression of feature maps during inference. Our method trains the model to achieve low-entropy feature maps, which enables efficient compression at inference time using classical transform coding methods. CAT significantly improves the state-of-the-art results reported for quantization. For example, on ResNet-34 we achieve 73.1% accuracy (0.2% degradation from the baseline) with an average representation of only 1.79 bits per value. Reference implementation accompanies the paper at https://github.com/CAT-teams/CAT

研究动机与目标

  • 解决硬件加速器中深度神经网络推理的高内存带宽和高能耗问题。
  • 通过基于熵的压缩方法,超越标准量化技术,进一步减少特征图的内存占用。
  • 开发一种训练方法,使激活更易压缩,同时不损失模型准确率。
  • 通过训练期间的可微分熵正则化,实现通用且与硬件无关的带宽减少。
  • 探索量化网络中压缩效率与模型准确率之间的率失真权衡。

提出的方法

  • 引入一种可微分的熵正则化损失,惩罚量化特征图中的高熵。
  • 将标准任务损失(如交叉熵)与由超参数 λ 控制的加权熵惩罚项相结合。
  • 使用软熵近似(如 Gumbel-Softmax 或类似方法),使熵项在量化过程中可微分。
  • 训练模型生成具有偏斜分布的量化激活(例如在零处出现尖锐峰值),以降低熵并提高可压缩性。
  • 在推理阶段应用标准熵编码(如霍夫曼编码或算术编码)以压缩低熵量化激活。
  • 在多种架构上验证该方法:ResNet、MobileNetV2 和以 VGG 为骨干的 SSD512,在不同位宽和 λ 值下进行测试。

实验结果

研究问题

  • RQ1通过训练深度网络最小化激活熵,是否能在不降低准确率的前提下提升可压缩性?
  • RQ2熵正则化如何影响量化 CNN 中的率失真权衡?
  • RQ3可微分熵正则化对不同随机初始化下的模型鲁棒性和收敛性有何影响?
  • RQ4该方法在分类和检测任务中,对不同网络架构和位宽(如 5–8 位)的可扩展性如何?
  • RQ5基于熵的压缩能否在几乎所有硬件平台上通用应用,并实现极低的推理开销?

主要发现

  • 在 ResNet-34 上,CAT 实现了 73.1% 的 top-1 准确率(较基线仅下降 0.2%),每数值仅需 1.79 位,相比无正则化训练,压缩率提高了 2.23 倍。
  • 对于 ResNet-18,该方法将平均激活表示降低至每数值 1.515 位(5 位量化),熵接近 1 位,实现了近乎最优的压缩效果。
  • 率失真权衡分析表明,每数值熵可降至 1 位以下,代价为 2% 的准确率下降,证明了其强大的压缩潜力。
  • 该方法在多个随机种子下表现稳健:ResNet-18 的准确率为 69.122% ± 0.016,每数值熵为 1.5150 ± 0.0087,方差极小。
  • 将软熵替换为可压缩性损失后,结果几乎完全一致(例如,可压缩性损失为 69.36% 准确率,熵损失为 69.49%),证实熵最小化是核心机制。
  • 将批量大小从 16 增加到 64 后,ResNet-50 的准确率提升了超过 0.5%,熵仅增加 0.1 位/数值,表明训练稳定性有所改善。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。