Skip to main content
QUICK REVIEW

[论文解读] Rethinking FUN: Frequency-Domain Utilization Networks

Kfir Goldberg, Stav Shapiro|arXiv (Cornell University)|Dec 6, 2020
Software Testing and Debugging Techniques参考文献 26被引用 10
一句话总结

本文提出频率域利用率网络(FUN),一类直接在离散余弦变换(DCT)系数而非RGB像素上运行的卷积神经网络(CNN),从而显著减少模型大小和推理延迟。通过利用现代架构组件(如复合缩放和倒残差模块),FUN模型在ImageNet上实现了最先进精度,同时支持无需微调的动态输入压缩,其中eFUN相比EfficientNet-B0模型缩小20%、速度提升65%,且精度损失极小。

ABSTRACT

The search for efficient neural network architectures has gained much focus in recent years, where modern architectures focus not only on accuracy but also on inference time and model size. Here, we present FUN, a family of novel Frequency-domain Utilization Networks. These networks utilize the inherent efficiency of the frequency-domain by working directly in that domain, represented with the Discrete Cosine Transform. Using modern techniques and building blocks such as compound-scaling and inverted-residual layers we generate a set of such networks allowing one to balance between size, latency and accuracy while outperforming competing RGB-based models. Extensive evaluations verifies that our networks present strong alternatives to previous approaches. Moreover, we show that working in frequency domain allows for dynamic compression of the input at inference time without any explicit change to the architecture.

研究动机与目标

  • 设计在精度、模型大小和推理延迟之间实现平衡的高效神经网络架构。
  • 探索使用频域表示(通过DCT)作为CNN的RGB输入替代方案。
  • 通过利用DCT表示的固有特性,在推理时实现无需微调的动态输入压缩。
  • 利用复合缩放和现代构建模块(如MBConv和倒残差)开发可扩展的模型家族。
  • 评估可学习的DCT类层是否能在保持效率和压缩优势的前提下,超越或替代固定的DCT变换。

提出的方法

  • 网络在将图像转换为YCbCr并对其每个8×8块应用离散余弦变换(DCT)后,处理频域特征图。
  • 作者设计了两种主要架构:基于残差块的ResFUN和基于倒残差(MBConv)块的eFUN,两者均直接在DCT系数上运行。
  • 通过应用复合缩放,生成一组具有不同深度、宽度和分辨率的FUN模型,以平衡精度、大小和延迟。
  • 通过在推理时将高频DCT系数置零实现输入压缩,利用低频分量主导感知内容的特性。
  • 引入一个可学习的DCT层,通过具有DCT类滤波器的卷积层实现,该层可单独训练(LeFUN)或端到端训练(LeFUN-e2e),以替代固定的DCT变换。
  • 使用标准指标(top-1精度、参数数量、FLOPs)在ImageNet上评估模型,并对输入通道减少进行消融分析。

实验结果

研究问题

  • RQ1通过DCT的频域表示能否在不牺牲精度的前提下,提升CNN在模型大小和推理延迟方面的效率?
  • RQ2在DCT基模型中,能否在不重新训练或性能下降的情况下,实现推理时的动态输入压缩?
  • RQ3在频域网络中,可学习的DCT类层与固定DCT变换相比,在精度和效率方面表现如何?
  • RQ4MBConv和复合缩放等现代架构组件能否有效适配频域输入,以构建可扩展的高效模型?
  • RQ5去除高频DCT系数对模型精度有何影响?这是否支持其固有的动态压缩能力?

主要发现

  • eFUN模型在ImageNet上相比EfficientNet-B0模型缩小20%,推理速度提升65%,且top-1精度仅略有下降。
  • 将输入DCT通道从192减少到88(减少54%)仅导致top-1精度下降1%,表明其具备强大的动态压缩能力。
  • 若去除75%的输入通道(从192减少到48),精度下降7.5%,表明高频分量对分类任务影响较小。
  • LeFUN-e2e变体达到77.2%的top-1精度,略高于固定eFUN模型(77.0%),但代价是模型尺寸增加且可解释性下降。
  • LeFUN和LeFUN-e2e中学习到的DCT类层滤波器与标准DCT滤波器显著不同,表明学习到的滤波器并未完全复制DCT的结构化、频率有序特性。
  • 固定DCT表示天然支持动态输入压缩,而使用可学习变换时,该特性会丧失,因为需为新的压缩级别重新训练模型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。