[论文解读] High performance ultra-low-precision convolutions on mobile devices
本文提出了一种针对移动端 ARMv7 CPU 的开源、高度优化的超低精度(亚4比特)卷积核实现,利用按位运算(XOR 和 POPCNT)加速二值内积计算。在 Cortex-A53 和 Cortex-A7 等低端设备上,相较于最先进的 float32 和 int8 基线模型,该方法实现了 4 倍至 20 倍的性能提升,证明了其在实时移动视觉工作负载中的实际可行性。
Many applications of mobile deep learning, especially real-time computer vision workloads, are constrained by computation power. This is particularly true for workloads running on older consumer phones, where a typical device might be powered by a single- or dual-core ARMv7 CPU. We provide an open-source implementation and a comprehensive analysis of (to our knowledge) the state of the art ultra-low-precision (<4 bit precision) implementation of the core primitives required for modern deep learning workloads on ARMv7 devices, and demonstrate speedups of 4x-20x over our additional state-of-the-art float32 and int8 baselines.
研究动机与目标
- 解决移动 CPU 上超低精度深度学习中尚未充分探索的计算与实现挑战。
- 在计算资源有限的低端移动设备上,实现高性能推理,支持实时计算机视觉应用。
- 对超低精度模型在多样化硬件、模型架构和基线实现下的性能进行公平且全面的评估。
- 开发并开源一个针对 ARMv7 和 AVX2 架构的超低精度神经网络高效运行时。
- 证明当搭配高度优化的核函数与合适的训练技术时,超低精度模型可实现显著的性能提升。
提出的方法
- 利用 ARMv7 的 XOR 和 POPCNT 指令,实现高效的二值内积微内核,以高效计算低精度向量点积。
- 采用打包的位布局表示方法,将每个比特深度存储为独立的二值向量,从而支持高效的 SIMD 处理。
- 应用标准优化技术,如寄存器分块和 L1 缓存分块,以最大化数据局部性并减少内存带宽压力。
- 将微内核集成到类似 BLIS 的软件栈中,抽象底层细节,实现在不同架构间的可重用性。
- 通过 Winograd 类变换优化 1×1 和 3×3 卷积核,使用预计算的滤波器权重,并可选地采用 FP16 中间存储,以减少内存带宽。
- 利用高级训练技术(如 HWGQ 量化和比特衰减微调)在将权重和激活值激进量化至 1–3 比特后,仍能保持模型精度。
实验结果
研究问题
- RQ1与 float32 和 int8 基线相比,超低精度(亚4比特)卷积在低端 ARMv7 移动 CPU 上是否能实现显著的性能提升?
- RQ2硬件微架构(如 Cortex-A53 与 Cortex-A7)如何影响超低精度核的性能优势?
- RQ3在 ARMv7 上,哪些实现技术最有效,能实现二值内积计算的接近理论峰值性能?
- RQ4在不牺牲模型精度的前提下,多大程度上可使激进量化(如权重和激活值为 1–2 比特)变得实用?
- RQ5不同的基线实现(float32、int8)如何影响移动设备上超低精度推理的感知性能收益?
主要发现
- 所提出的超低精度卷积核在 ARMv7 设备上,相较于 float32 基线最高可实现 20 倍性能提升,相较于 int8 基线最高可实现 4 倍性能提升。
- 在 1.4GHz 的 Cortex-A53 上,微基准测试中性能达到理论峰值的约 75%。
- 对于 3×3 和 1×1 卷积,在特定层配置下,Cortex-A53 上性能提升达 9.5 倍,Cortex-A7 上达 11 倍。
- 使用预计算的 Winograd 变换滤波器和可选的 FP16 中间存储,性能相比标准 GEMMLOWP 基线最高提升 2.5 倍。
- 在某些情况下,该实现相比先前开源的 ARMv7 实现性能提升超过一个数量级,几何平均速度提升达 3.7 倍。
- 通过采用 HWGQ 量化和比特衰减微调等先进训练技术,2 比特激活值和 1 比特权重仍能保持高精度,使超低精度模型在实际部署中具备可行性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。