Skip to main content
QUICK REVIEW

[论文解读] A Reconfigurable Winograd CNN Accelerator with Nesting Decomposition Algorithm for Computing Convolution with Large Filters.

Jingbo Jiang, Xizi Chen|arXiv (Cornell University)|Feb 26, 2021
Advanced Image Processing Techniques参考文献 18被引用 6
一句话总结

本文提出一种可重构的Winograd卷积神经网络加速器,采用嵌套分解算法将大卷积核(5×5至9×9)分解为3×3块的序列,通过3×3 Winograd变换实现高效计算。与最先进的OLA-Winograd算法相比,该方法将乘法运算量减少1.41倍至3.29倍,显著提升了卷积神经网络中大核卷积的计算效率。

ABSTRACT

Recent literature found that convolutional neural networks (CNN) with large filters perform well in some applications such as image semantic segmentation. Winograd transformation helps to reduce the number of multiplications in a convolution but suffers from numerical instability when the convolution filter size gets large. This work proposes a nested Winograd algorithm to iteratively decompose a large filter into a sequence of 3x3 tiles which can then be accelerated with a 3x3 Winograd algorithm. Compared with the state-of-art OLA-Winograd algorithm, the proposed algorithm reduces the multiplications by 1.41 to 3.29 times for computing 5x5 to 9x9 convolutions.

研究动机与目标

  • 解决Winograd变换在卷积神经网络中应用于大卷积核时的数值不稳定性问题。
  • 提升大核卷积运算的计算效率,尤其在图像语义分割等应用场景中。
  • 设计一种可扩展且可重构的硬件加速器,支持通过分解方法高效计算大核卷积。
  • 在现有OLA-Winograd方法的基础上,进一步减少卷积运算中的乘法次数。
  • 通过算法创新降低计算开销,实现大核卷积神经网络在实际场景中的可部署性。

提出的方法

  • 提出一种嵌套Winograd算法,将大卷积核(如5×5、7×7、9×9)迭代分解为3×3卷积核块的序列。
  • 对每个3×3块应用3×3 Winograd变换,以减少卷积运算中的乘法次数。
  • 采用基于分块的分解策略,通过避免对大卷积核直接应用Winograd变换来维持数值稳定性。
  • 设计一种可重构的加速器架构,支持不同卷积核尺寸和计算模式之间的动态切换。
  • 将嵌套分解与现有的基于Winograd的加速技术相结合,在保持精度的同时提升效率。
  • 优化加速器中的数据流与内存访问模式,以支持3×3块的顺序处理。

实验结果

研究问题

  • RQ1是否可通过将大卷积核分解为更小且数值稳定的组件,来缓解基于Winograd的卷积运算中的数值不稳定性?
  • RQ2与OLA-Winograd方法相比,嵌套分解算法在5×5至9×9卷积中能将乘法次数减少多少?
  • RQ3所提出的算法在实现显著计算节省的同时,如何保持数值精度?
  • RQ4采用嵌套分解方法的可重构加速器在硬件效率方面能获得多大提升?
  • RQ5该方法能否有效扩展以支持实际CNN推理工作负载中多种大核卷积尺寸?

主要发现

  • 与OLA-Winograd方法相比,所提出的嵌套分解算法在5×5卷积中可将乘法次数减少1.41倍。
  • 在7×7卷积中,所提方法相比最先进的OLA-Winograd方法,乘法次数减少达2.34倍。
  • 在9×9卷积中,该算法可将乘法次数最多减少3.29倍,显著提升计算效率。
  • 通过避免对大卷积核直接应用Winograd变换,该分解策略有效维持了数值稳定性。
  • 可重构加速器设计实现了对嵌套分解的高效硬件映射,适用于实时CNN推理。
  • 该方法为在资源受限环境中部署大核卷积神经网络提供了切实可行的路径,且无需牺牲性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。