[论文解读] DCT Perceptron Layer: A Transform Domain Approach for Convolution Layer
本文提出DCT感知器层,一种新型变换域神经网络层,通过利用DCT卷积定理,在DCT域中使用逐元素乘法执行类似卷积的操作,从而用其替代ResNet中的$3\times3$ Conv2D层。该方法在ImageNet-1K上将参数量减少21%以上,MACs减少32%以上,同时保持相近的准确率,并且在全局平均池化后插入批量归一化时可进一步提升准确率。
In this paper, we propose a novel Discrete Cosine Transform (DCT)-based neural network layer which we call DCT-perceptron to replace the $3 imes3$ Conv2D layers in the Residual neural Network (ResNet). Convolutional filtering operations are performed in the DCT domain using element-wise multiplications by taking advantage of the Fourier and DCT Convolution theorems. A trainable soft-thresholding layer is used as the nonlinearity in the DCT perceptron. Compared to ResNet's Conv2D layer which is spatial-agnostic and channel-specific, the proposed layer is location-specific and channel-specific. The DCT-perceptron layer reduces the number of parameters and multiplications significantly while maintaining comparable accuracy results of regular ResNets in CIFAR-10 and ImageNet-1K. Moreover, the DCT-perceptron layer can be inserted with a batch normalization layer before the global average pooling layer in the conventional ResNets as an additional layer to improve classification accuracy.
研究动机与目标
- 在不牺牲准确率的前提下,减轻ResNet等深度卷积神经网络的计算与参数负担。
- 使用离散余弦变换(DCT)将标准$3\times3$ Conv2D层替换为更高效的变换域替代方案。
- 通过反向传播实现DCT域中网络滤波器的端到端训练。
- 利用快速实值DCT和逐元素运算,提升边缘设备上的模型效率。
- 探索在DCT域中使用可学习的软阈值化作为非线性激活函数,以实现更优的特征学习。
提出的方法
- DCT感知器层通过输入DCT系数与学习滤波器系数之间的逐元素乘法,在DCT域中执行卷积操作,利用DCT卷积定理实现。
- 该方法采用可学习的软阈值化函数作为非线性激活,实现在频域中的有效激活学习。
- 该层通过前向和逆DCT(DCT与IDCT)变换实现,采用$O(N\log_2 N)$的快速算法以提升效率。
- DCT基层被插入到残差块中,替代$3\times3$ Conv2D层,保持空间与通道的特异性。
- 在DCT之后使用$1\times1$ Conv2D层,以实现跨通道的特征变换与参数共享。
- 在全局平均池化前插入额外的DCT感知器层并配合批量归一化,可在计算开销极低的情况下进一步提升准确率。
实验结果
研究问题
- RQ1能否通过逐元素乘法在DCT域中高效且准确地执行卷积操作,从而替代标准的空间卷积?
- RQ2在图像分类基准上,DCT基层与标准Conv2D层在准确率、参数量和MACs方面的性能表现如何比较?
- RQ3在DCT域中使用可学习的软阈值化是否能有效替代ReLU类非线性激活,同时保持模型的表征能力?
- RQ4在CIFAR-10和ImageNet-1K上,用DCT感知器层替代Conv2D层是否能降低模型复杂度而不降低准确率?
- RQ5在全局平均池化前插入额外的DCT感知器层,是否能提升现有ResNets的准确率?
主要发现
- 在CIFAR-10上,DCT感知器层将参数量减少44.39%,同时准确率仅比基线ResNet-20低0.07%。
- 在CIFAR-10上,该方法在参数量减少26.64%的同时,准确率提升了0.09%。
- 在ImageNet-1K上,DCT-ResNet-50模型将参数量减少28.5%,MACs减少32.8%,中心裁剪top-1准确率仅下降0.89%。
- 三脚架结构的DCT-ResNet-50变体将参数量减少21.1%,MACs减少32.6%,同时保持75.52%的top-1准确率(基线为76.06%)。
- 在全局平均池化前插入额外的DCT感知器层,使ResNet-18的top-1准确率从69.76%提升至70.50%,参数量仅增加2.3%。
- 额外的DCT层使ResNet-50的top-5准确率从92.85%提升至93.80%,参数量增加16.4%,MACs增加可忽略。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。