Skip to main content
QUICK REVIEW

[论文解读] Learning Convolutional Neural Networks in the Frequency Domain

Hengyue Pan, Chen, Yixin|arXiv (Cornell University)|Apr 14, 2022
Neural Networks and Applications被引用 5
一句话总结

该论文提出 CEMNET,一种完全在频域中训练的新型卷积神经网络,利用离散傅里叶变换(DFT)将计算密集的卷积操作替换为通过互相关定理实现的高效逐元素乘法。它引入了权重固定机制以缓解过拟合,并设计了批量归一化、Leaky ReLU 和 Dropout 在频域中的等效形式,在 MNIST 和 CIFAR-10 上实现了最先进性能,且 FLOPs 显著减少,包括在 CIFAR-10 上实现超过 70% 的准确率——使其成为首个达成此目标的此类模型。

ABSTRACT

Convolutional neural network (CNN) has achieved impressive success in computer vision during the past few decades. The image convolution operation helps CNNs to get good performance on image-related tasks. However, the image convolution has high computation complexity and hard to be implemented. This paper proposes the CEMNet, which can be trained in the frequency domain. The most important motivation of this research is that we can use the straightforward element-wise multiplication operation to replace the image convolution in the frequency domain based on the Cross-Correlation Theorem, which obviously reduces the computation complexity. We further introduce a Weight Fixation mechanism to alleviate the problem of over-fitting, and analyze the working behavior of Batch Normalization, Leaky ReLU, and Dropout in the frequency domain to design their counterparts for CEMNet. Also, to deal with complex inputs brought by Discrete Fourier Transform, we design a two-branches network structure for CEMNet. Experimental results imply that CEMNet achieves good performance on MNIST and CIFAR-10 databases.

研究动机与目标

  • 通过在频域中直接进行学习,降低卷积神经网络的计算复杂度。
  • 解决在频域中训练的挑战,其中由于 DFT 的存在输入为复数值,且需实现有效的反向传播。
  • 设计标准深度学习组件(如批量归一化、Leaky ReLU 和 Dropout)在频域中的等效形式。
  • 通过一种新颖的权重固定机制,克服频域训练中的过拟合问题。
  • 证明在频域中进行端到端训练在图像分类任务中是可行且有效的,并在标准基准测试中实现具有竞争力的性能。

提出的方法

  • 核心机制利用互相关定理,将图像卷积替换为在频域中的逐元素乘法,该定理指出:互相关结果的 DFT 等于输入的 DFT 与滤波器的复共轭 DFT 的逐元素乘积。
  • 设计了双分支网络结构,以处理 DFT 产生的复值特征图,从而在反向传播中实现实值参数更新。
  • 引入了权重固定机制,通过在训练过程中冻结早期块的权重,减少可训练参数数量,从而降低过拟合风险。
  • 推导并实现了批量归一化、Leaky ReLU 和 Dropout 在频域中的适应形式,以维持训练稳定性和泛化能力。
  • 使用标准优化技术进行训练,采用余弦衰减学习率调度策略,CIFAR-10 实验中未使用数据增强。
  • 通过 FLOPs 测量前向和反向传播操作,量化计算效率的提升。

实验结果

研究问题

  • RQ1能否使用 DFT 在频域中端到端训练卷积神经网络,将标准卷积操作替换为逐元素乘法?
  • RQ2如何有效适配标准深度学习组件(如批量归一化、ReLU 和 Dropout)以用于频域?
  • RQ3在参数更新受限的情况下,可采用何种机制缓解频域训练中的过拟合?
  • RQ4频域网络能否在 MNIST 和 CIFAR-10 等标准视觉基准上实现具有竞争力的性能?
  • RQ5与标准 CNN 相比,频域训练在前向和反向传播中的计算复杂度(以 FLOPs 衡量)如何?

主要发现

  • CEMNET 在 MNIST 数据集上达到 0.67% 的测试误差,优于以往频域模型,接近标准 CNN 的性能。
  • 在 CIFAR-10 上,Small CEMNET 达到 22.40% 的测试误差,与对应的小型 CNN(21.07%)相当,表明其在 FLOPs 显著减少的情况下仍具备强大泛化能力。
  • Large CEMNET 在 CIFAR-10 上达到 21.63% 的测试误差,表明模型随深度增加可合理扩展,尽管由于权重固定导致的梯度消失,性能仍落后于全尺寸 CNN。
  • CEMNET 的前向和反向 FLOP 数量显著降低——分别为约 368K 和 481K,相较于标准 CNN 显示出显著的计算节省。
  • CEMNET 是首个在 CIFAR-10 上实现超过 70% 准确率的频域模型,标志着频域深度学习中的一个关键里程碑。
  • 双分支网络结构成功处理了复值 DFT 输出,并实现了基于实值梯度的稳定训练。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。