Skip to main content
QUICK REVIEW

[论文解读] TerViT: An Efficient Ternary Vision Transformer

Sheng Xu, Yanjing Li|arXiv (Cornell University)|Jan 20, 2022
CCD and CMOS Imaging Sensors被引用 5
一句话总结

TerViT 提出了一种新颖的三值视觉变换器(ViT),通过从 8 位到 2 位权重的渐进式训练以及通道级三值化,实现了高模型压缩率,同时保持极小的精度损失。该方法将 Swin-S 模型大小缩减至 13.1MB,同时在 ImageNet 上保持 79.5% 的 Top-1 准确率,相较于以往的 2 位方法最高提升 4%,并显著缩小了与全精度模型之间的差距。

ABSTRACT

Vision transformers (ViTs) have demonstrated great potential in various visual tasks, but suffer from expensive computational and memory cost problems when deployed on resource-constrained devices. In this paper, we introduce a ternary vision transformer (TerViT) to ternarize the weights in ViTs, which are challenged by the large loss surface gap between real-valued and ternary parameters. To address the issue, we introduce a progressive training scheme by first training 8-bit transformers and then TerViT, and achieve a better optimization than conventional methods. Furthermore, we introduce channel-wise ternarization, by partitioning each matrix to different channels, each of which is with an unique distribution and ternarization interval. We apply our methods to popular DeiT and Swin backbones, and extensive results show that we can achieve competitive performance. For example, TerViT can quantize Swin-S to 13.1MB model size while achieving above 79% Top-1 accuracy on ImageNet dataset.

研究动机与目标

  • 为解决视觉变换器在资源受限设备上的高计算与内存开销问题。
  • 克服视觉变换器三值量化的优化难题,该难题源于实值参数与三值参数之间巨大的损失曲面差距。
  • 通过引入考虑各通道权重分布差异的通道级三值化,提升量化的稳定性和性能。
  • 通过从 8 位模型开始的渐进式训练方案,弥合实值与三值视觉变换器之间的优化差距。
  • 在低比特视觉变换器量化中实现最先进性能,实现高压缩率与极小的精度损失。

提出的方法

  • 提出渐进式训练方案:先训练一个 8 位视觉变换器,再以其作为代理初始化并训练最终的三值视觉变换器,从而降低优化不稳定性。
  • 采用通道级三值化,即对每个通道独立地根据其权重分布,使用唯一的量化区间映射到三值(±1, 0)。
  • 使用 8 位激活量化,在保持激活精度的同时降低内存占用和 FLOPs,尤其适用于图像块嵌入和分类头层。
  • 根据 Hessian 特征值分析结果,将首层(图像块嵌入)和末层(分类头)以 8 位格式保存,因其具有较高敏感性。
  • 采用两阶段训练流程:首先预训练 8 位模型,然后通过量化解耦训练(QAT)对三值模型进行微调,以稳定收敛过程。
  • 可视化损失曲面,表明三值模型的损失曲面比 8 位或实值模型更陡峭、更复杂,从而证明渐进式训练的必要性。

实验结果

研究问题

  • RQ1尽管实值参数与三值参数之间存在巨大的优化差距,三值量化是否仍能有效应用于视觉变换器?
  • RQ2与直接进行三值训练相比,从 8 位模型开始的渐进式训练是否能提升三值视觉变换器的收敛性和性能?
  • RQ3通过自适应各通道权重分布方差,通道级三值化是否能提升量化的稳定性和性能?
  • RQ4与现有的 2 位和 8 位量化基线相比,该方法在 ImageNet 上的压缩率和准确率表现如何?
  • RQ5对首层和末层进行量化的性能影响是什么?是否可以使用 8 位精度来平衡性能与效率?

主要发现

  • TerViT 将 Swin-S 模型大小压缩至 13.1MB,压缩比达 15.25 倍,在 ImageNet 上实现 79.5% 的 Top-1 准确率,较全精度模型仅损失 4% 以内。
  • 在 DeiT-S 上,TerViT 实现 74.2% 的 Top-1 准确率,压缩比达 14.70 倍,较基线方法 TWN 提升 4.0%。
  • 在 DeiT-B 上,TerViT 实现 76.1% 的 Top-1 准确率,压缩比达 15.25 倍,较 TWN 基线的 72.9% 准确率高出 3.2%。
  • 该方法显著缩小了三值视觉变换器与实值模型之间的性能差距,TerDeiT-B 在相同模型尺寸下较实值 DeiT-T 提升 3.9%。
  • 8 位量化的首层和末层仅导致 0.3% 的准确率损失,相较于 32 位精度,验证了其在保持性能的同时降低位宽的可行性。
  • 通道级三值化提升了量化的稳定性,表现为训练后权重分布的通道级绝对均值(CAM)更低,标准差(SDAM)更高。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。