Skip to main content
QUICK REVIEW

[论文解读] Fast Fourier Transformation for Optimizing Convolutional Neural Networks in Object Recognition

Varsha Nair, Moitrayee Chatterjee|arXiv (Cornell University)|Oct 8, 2020
Advanced Neural Network Applications参考文献 20被引用 12
一句话总结

本论文提出一种基于FFT的U-Net架构,通过将图像和卷积核数据转换到频域,实现高效的逐元素乘法卷积,从而加速卷积神经网络(CNN)在目标识别中的运算。该方法将每步训练时间从600–700 ms/step减少至400–500 ms/step,并在BBBC数据集上将平均交并比(IoU)从0.52提升至0.83,证明了其具备更快的收敛速度和更高的分割精度。

ABSTRACT

This paper proposes to use Fast Fourier Transformation-based U-Net (a refined fully convolutional networks) and perform image convolution in neural networks. Leveraging the Fast Fourier Transformation, it reduces the image convolution costs involved in the Convolutional Neural Networks (CNNs) and thus reduces the overall computational costs. The proposed model identifies the object information from the images. We apply the Fast Fourier transform algorithm on an image data set to obtain more accessible information about the image data, before segmenting them through the U-Net architecture. More specifically, we implement the FFT-based convolutional neural network to improve the training time of the network. The proposed approach was applied to publicly available Broad Bioimage Benchmark Collection (BBBC) dataset. Our model demonstrated improvement in training time during convolution from $600-700$ ms/step to $400-500$ ms/step. We evaluated the accuracy of our model using Intersection over Union (IoU) metric showing significant improvements.

研究动机与目标

  • 降低用于目标识别的卷积神经网络中卷积运算的高计算成本。
  • 提升用于医学图像分割的深度学习模型的训练效率与收敛速度。
  • 评估在U-Net架构输入层集成快速傅里叶变换(FFT)对增强特征学习的有效性。
  • 证明频域变换可提升分割精度与训练稳定性。
  • 为移动设备和嵌入式系统等资源受限环境提供一种计算高效的替代方案。

提出的方法

  • 在将输入图像数据送入U-Net模型前应用快速傅里叶变换(FFT),将空间域卷积转换为频域中的逐元素乘法运算。
  • 实现基于FFT的卷积层,替代标准卷积操作,降低大卷积核的计算复杂度。
  • 采用U-Net架构作为全卷积神经网络,用于生物医学图像的语义分割,并通过FFT预处理加速特征提取。
  • 使用交叉熵损失函数进行模型训练,并采用Adam优化器进行优化,对比有无FFT预处理的性能表现。
  • 对预测掩码应用后处理,包括局部极大值检测与DBScan聚类,以从分割结果中识别出目标对象。
  • 通过交并比(IoU)、对数损失(log-loss)以及训练集与验证集上的平均IoU来评估模型性能。

实验结果

研究问题

  • RQ1基于FFT的卷积是否能显著减少U-Net在目标识别任务中的训练时间?
  • RQ2将输入数据转换到频域是否能提升CNN中的分割精度?
  • RQ3FFT预处理如何影响训练损失与IoU指标的稳定性与收敛性?
  • RQ4FFT加速能否在不损害特征表示能力的前提下有效应用于生物医学图像分割?
  • RQ5FFT处理带来的性能提升在不同训练轮次与数据划分中是否保持一致?

主要发现

  • 基于FFT的模型将卷积训练时间从600–700 ms/step减少至400–500 ms/step,训练速度提升达28.6%至33.3%。
  • 在100个训练轮次后,基于FFT的模型平均IoU达到0.83,而无FFT模型仅为0.52,表明精度有显著提升。
  • 基于FFT的模型对数损失稳定在-0.875左右,显著低于无FFT模型的-0.6025,表明其优化效果更好且泛化能力更强。
  • IoU指标曲线显示,FFT模型在100个训练轮次内表现一致且稳定,而无FFT模型则表现出损失与IoU值的波动。
  • 对FFT处理后的输出应用DBScan聚类识别出20个独立聚类,证实了从优化后的分割掩码中实现了有效的目标定位。
  • 基于FFT的模型达到0.8747的IoU与-0.8753的交叉验证损失,优于无FFT模型的0.6815 IoU与-0.6025损失。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。