Skip to main content
QUICK REVIEW

[论文解读] Frequency Domain Convolutional Neural Network: Accelerated CNN for Large Diabetic Retinopathy Image Classification

Ee Fey Goh, Zhiyuan Chen|arXiv (Cornell University)|Jun 24, 2021
Retinal Imaging and Analysis参考文献 15被引用 4
一句话总结

本文提出频域卷积神经网络(FDCNN),包含频域卷积(FDC)与频域池化(FDP)层,以加速大规模糖尿病视网膜病变(DR)图像的训练。通过利用RFFT、卷积核初始化、伪影消除以及通道独立卷积,FDCNN相较标准CNN实现54.21%的训练加速与70.74%更高的内存效率,而采用完整FDC层的改进VGG16在DR分类任务中达到95.63%的准确率。

ABSTRACT

The conventional spatial convolution layers in the Convolutional Neural Networks (CNNs) are computationally expensive at the point where the training time could take days unless the number of layers, the number of training images or the size of the training images are reduced. The image size of 256x256 pixels is commonly used for most of the applications of CNN, but this image size is too small for applications like Diabetic Retinopathy (DR) classification where the image details are important for accurate classification. This research proposed Frequency Domain Convolution (FDC) and Frequency Domain Pooling (FDP) layers which were built with RFFT, kernel initialization strategy, convolution artifact removal and Channel Independent Convolution (CIC) to replace the conventional convolution and pooling layers. The FDC and FDP layers are used to build a Frequency Domain Convolutional Neural Network (FDCNN) to accelerate the training of large images for DR classification. The Full FDC layer is an extension of the FDC layer to allow direct use in conventional CNNs, it is also used to modify the VGG16 architecture. FDCNN is shown to be at least 54.21% faster and 70.74% more memory efficient compared to an equivalent CNN architecture. The modified VGG16 architecture with Full FDC layer is reported to achieve a shorter training time and a higher accuracy at 95.63% compared to the original VGG16 architecture for DR classification.

研究动机与目标

  • 解决在大规模糖尿病视网膜病变(DR)图像上训练深度CNN所面临的高计算成本问题。
  • 克服标准空间卷积层在处理高分辨率图像时速度慢、内存占用高的局限性。
  • 开发频域替代方案——FDC与FDP层,以在保持准确率的同时提升训练速度与效率。
  • 实现对大尺寸图像(如256x256或更大)的有效利用,以支持DR分类任务,其中细微特征至关重要。
  • 将所提出的层无缝集成至现有网络架构(如VGG16)中,实现性能提升而无需对网络结构进行大规模重构。

提出的方法

  • 提出使用实值RFFT的频域卷积(FDC)层,将空间卷积转换为频域运算,降低计算复杂度。
  • 设计专为频域学习优化的卷积核初始化策略,以稳定训练过程并提升收敛性。
  • 应用卷积伪影消除技术,以最小化频域运算引入的失真。
  • 采用通道独立卷积(CIC)技术,解耦通道处理流程,提升频域中的计算效率。
  • 开发频域池化(FDP)层,在频域中执行空间下采样,保留关键特征的同时降低维度。
  • 提出完整FDC层作为标准卷积层的即插即用替代方案,支持无缝集成至VGG16等现有CNN架构中。

实验结果

研究问题

  • RQ1频域运算是否能显著降低CNN在大规模医学图像上的训练时间与内存占用?
  • RQ2在糖尿病视网膜病变分类任务中,FDCNN相较于标准CNN在准确率与效率方面的表现如何?
  • RQ3FDC与FDP层在高分辨率眼底图像中对诊断相关特征的保留程度如何?
  • RQ4完整FDC层能否在不从头训练的前提下,有效集成至VGG16等成熟网络架构中?
  • RQ5所提方法是否在支持更大图像输入的同时,保持或提升分类准确率?

主要发现

  • FDCNN相较等效的标准CNN架构,训练速度至少提升54.21%。
  • FDCNN模型在训练过程中展现出比传统CNN高70.74%的内存效率。
  • 采用完整FDC层的改进VGG16在糖尿病视网膜病变分类任务中达到95.63%的测试准确率,优于原始VGG16。
  • 频域运算的使用使大尺寸图像的有效训练成为可能,且不以牺牲速度或内存效率为代价。
  • 所提出的卷积核初始化与伪影消除技术显著提升了频域训练的稳定性与特征保真度。
  • 完整FDC层可实现与现有CNN的无缝集成,无需网络结构重构即可获得性能提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。