Skip to main content
QUICK REVIEW

[论文解读] Frequency learning for image classification

José Augusto Stuchi, Levy Boccato|arXiv (Cornell University)|Jun 28, 2020
Image and Signal Denoising Methods参考文献 15被引用 11
一句话总结

本文提出 FreqNet,一种轻量级深度学习架构,通过在频域应用可学习的频率滤波器来提升图像分类性能。通过使用 DFT 将图像块转换到频域,并利用反向传播学习具有区分性的频谱分量,FreqNet 在 Kylberg 数据集上达到 99.73% 的准确率,在白内障检测任务上达到 93.00%,在图像质量分类任务上达到 98.30%,参数量仅为 AlexNet 的 1/100,展示了频域学习在高效、实时模型中的潜力。

ABSTRACT

Machine learning applied to computer vision and signal processing is achieving results comparable to the human brain on specific tasks due to the great improvements brought by the deep neural networks (DNN). The majority of state-of-the-art architectures nowadays are DNN related, but only a few explore the frequency domain to extract useful information and improve the results, like in the image processing field. In this context, this paper presents a new approach for exploring the Fourier transform of the input images, which is composed of trainable frequency filters that boost discriminative components in the spectrum. Additionally, we propose a slicing procedure to allow the network to learn both global and local features from the frequency-domain representations of the image blocks. The proposed method proved to be competitive with respect to well-known DNN architectures in the selected experiments, with the advantage of being a simpler and lightweight model. This work also raises the discussion on how the state-of-the-art DNNs architectures can exploit not only spatial features, but also the frequency, in order to improve its performance when solving real world problems.

研究动机与目标

  • 探索频域在深度学习图像分类中的应用,突破传统空间域卷积神经网络的限制。
  • 开发一种新型神经网络架构,直接学习频域特征,而非依赖手工设计的谱特征。
  • 通过基于块的傅里叶变换,利用频域表示捕捉图像的全局与局部特征,提升模型效率。
  • 评估频域学习是否能在特定图像分类任务中超越或匹配当前最先进的深度神经网络,尤其是在具有强谱特征的任务中。
  • 证明频域深度学习在实时与移动应用中的可行性与优势。

提出的方法

  • 该方法对小的、非重叠的图像块应用离散傅里叶变换(DFT),将空间域数据转换为频域表示。
  • 在每个块的幅度谱上应用可学习的频率滤波器,以突出具有区分性的频率分量。
  • 采用切片处理策略,提取同时包含全局(整幅图像)和局部(块级别)频率表示的信息,以增强特征学习能力。
  • 利用反向传播更新频率滤波器权重,实现频谱特征的端到端学习。
  • 网络架构命名为 FreqNet,将经过频率滤波的表示通过全连接层处理,输出最终分类结果。
  • 使用标准随机梯度下降与交叉熵损失进行训练,所有操作均可微分,以支持反向传播。

实验结果

研究问题

  • RQ1在频域中直接训练的深度神经网络能否在图像分类任务上达到与当前最先进的空间域模型相媲美甚至更优的性能?
  • RQ2通过可学习滤波器学习频域特征,与使用固定的手工谱特征相比,在准确率和效率方面有何差异?
  • RQ3通过基于切片的分块处理策略,频域表示能否有效捕捉图像的全局与局部特征?
  • RQ4在哪些类型的图像分类问题中,频域学习相比空间域学习具有性能优势?
  • RQ5在特定现实应用场景中,轻量级频域模型能否超越更深、参数更多的深度神经网络?

主要发现

  • FreqNet 在 Kylberg 纹理数据集上达到 99.73% 的准确率,略低于 AlexNet 的 99.82%,但参数量仅为后者的 1/100。
  • 在白内障检测数据集上,FreqNet 达到 93.00% 的准确率,优于微调后的 AlexNet(87.00%),可能得益于频域对模糊和雾霾等退化特征的敏感性。
  • 在视网膜图像质量数据集上,FreqNet 达到 98.30% 的准确率,与 AlexNet 的 98.82% 和 Xception 的 98.08% 相当,展现出与更复杂架构相媲美的强竞争力。
  • FreqNet 的训练时间约为 1.5 天(仅使用 CPU),远快于 Xception 的 14 天,表明其在硬件优化方面具有巨大潜力。
  • 结果表明,频域学习可生成高度高效的模型,适用于移动设备与实时应用,尤其在图像退化或周期性模式相关任务中优势明显。
  • 研究建议未来在深度神经网络中结合空间与频域特征,可进一步提升性能,特别是在具有强谱特性的信号中。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。