Skip to main content
QUICK REVIEW

[论文解读] DCT Perceptron Layer: A Transform Domain Approach for Convolution Layer

Hongyi Pan, Xin Zhu|arXiv (Cornell University)|Nov 15, 2022
Neural Networks and Applications被引用 5
一句话总结

本文提出DCT感知器层,一种新型变换域神经网络层,通过利用DCT卷积定理,在DCT域中使用逐元素乘法执行类似卷积的操作,从而用其替代ResNet中的$3\times3$ Conv2D层。该方法在ImageNet-1K上将参数量减少21%以上,MACs减少32%以上,同时保持相近的准确率,并且在全局平均池化后插入批量归一化时可进一步提升准确率。

ABSTRACT

In this paper, we propose a novel Discrete Cosine Transform (DCT)-based neural network layer which we call DCT-perceptron to replace the $3 imes3$ Conv2D layers in the Residual neural Network (ResNet). Convolutional filtering operations are performed in the DCT domain using element-wise multiplications by taking advantage of the Fourier and DCT Convolution theorems. A trainable soft-thresholding layer is used as the nonlinearity in the DCT perceptron. Compared to ResNet's Conv2D layer which is spatial-agnostic and channel-specific, the proposed layer is location-specific and channel-specific. The DCT-perceptron layer reduces the number of parameters and multiplications significantly while maintaining comparable accuracy results of regular ResNets in CIFAR-10 and ImageNet-1K. Moreover, the DCT-perceptron layer can be inserted with a batch normalization layer before the global average pooling layer in the conventional ResNets as an additional layer to improve classification accuracy.

研究动机与目标

  • 在不牺牲准确率的前提下,减轻ResNet等深度卷积神经网络的计算与参数负担。
  • 使用离散余弦变换(DCT)将标准$3\times3$ Conv2D层替换为更高效的变换域替代方案。
  • 通过反向传播实现DCT域中网络滤波器的端到端训练。
  • 利用快速实值DCT和逐元素运算,提升边缘设备上的模型效率。
  • 探索在DCT域中使用可学习的软阈值化作为非线性激活函数,以实现更优的特征学习。

提出的方法

  • DCT感知器层通过输入DCT系数与学习滤波器系数之间的逐元素乘法,在DCT域中执行卷积操作,利用DCT卷积定理实现。
  • 该方法采用可学习的软阈值化函数作为非线性激活,实现在频域中的有效激活学习。
  • 该层通过前向和逆DCT(DCT与IDCT)变换实现,采用$O(N\log_2 N)$的快速算法以提升效率。
  • DCT基层被插入到残差块中,替代$3\times3$ Conv2D层,保持空间与通道的特异性。
  • 在DCT之后使用$1\times1$ Conv2D层,以实现跨通道的特征变换与参数共享。
  • 在全局平均池化前插入额外的DCT感知器层并配合批量归一化,可在计算开销极低的情况下进一步提升准确率。

实验结果

研究问题

  • RQ1能否通过逐元素乘法在DCT域中高效且准确地执行卷积操作,从而替代标准的空间卷积?
  • RQ2在图像分类基准上,DCT基层与标准Conv2D层在准确率、参数量和MACs方面的性能表现如何比较?
  • RQ3在DCT域中使用可学习的软阈值化是否能有效替代ReLU类非线性激活,同时保持模型的表征能力?
  • RQ4在CIFAR-10和ImageNet-1K上,用DCT感知器层替代Conv2D层是否能降低模型复杂度而不降低准确率?
  • RQ5在全局平均池化前插入额外的DCT感知器层,是否能提升现有ResNets的准确率?

主要发现

  • 在CIFAR-10上,DCT感知器层将参数量减少44.39%,同时准确率仅比基线ResNet-20低0.07%。
  • 在CIFAR-10上,该方法在参数量减少26.64%的同时,准确率提升了0.09%。
  • 在ImageNet-1K上,DCT-ResNet-50模型将参数量减少28.5%,MACs减少32.8%,中心裁剪top-1准确率仅下降0.89%。
  • 三脚架结构的DCT-ResNet-50变体将参数量减少21.1%,MACs减少32.6%,同时保持75.52%的top-1准确率(基线为76.06%)。
  • 在全局平均池化前插入额外的DCT感知器层,使ResNet-18的top-1准确率从69.76%提升至70.50%,参数量仅增加2.3%。
  • 额外的DCT层使ResNet-50的top-5准确率从92.85%提升至93.80%,参数量增加16.4%,MACs增加可忽略。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。