Skip to main content
QUICK REVIEW

[论文解读] Wavelet-Attention CNN for Image Classification

Xiangyu Zhao|arXiv (Cornell University)|Jan 23, 2022
Advanced Neural Network Applications被引用 4
一句话总结

该论文提出了一种新型卷积神经网络——小波注意力卷积神经网络(WA-CNN),通过在离散小波变换(DWT)框架下引入小波注意力(WA)模块,选择性地聚焦于高频细节,同时保留低频结构特征,从而提升图像分类性能。WA模块通过滤除噪声并突出相关高频信息,增强了特征学习能力,在使用MobileNetV2主干网络时,CIFAR-10和CIFAR-100数据集上的Top-1准确率分别提升了1.26%和1.54%。

ABSTRACT

The feature learning methods based on convolutional neural network (CNN) have successfully produced tremendous achievements in image classification tasks. However, the inherent noise and some other factors may weaken the effectiveness of the convolutional feature statistics. In this paper, we investigate Discrete Wavelet Transform (DWT) in the frequency domain and design a new Wavelet-Attention (WA) block to only implement attention in the high-frequency domain. Based on this, we propose a Wavelet-Attention convolutional neural network (WA-CNN) for image classification. Specifically, WA-CNN decomposes the feature maps into low-frequency and high-frequency components for storing the structures of the basic objects, as well as the detailed information and noise, respectively. Then, the WA block is leveraged to capture the detailed information in the high-frequency domain with different attention factors but reserves the basic object structures in the low-frequency domain. Experimental results on CIFAR-10 and CIFAR-100 datasets show that our proposed WA-CNN achieves significant improvements in classification accuracy compared to other related networks. Specifically, based on MobileNetV2 backbones, WA-CNN achieves 1.26% Top-1 accuracy improvement on the CIFAR-10 benchmark and 1.54% Top-1 accuracy improvement on the CIFAR-100 benchmark.

研究动机与目标

  • 解决由于特征图中存在噪声和冗余高频分量导致CNN特征表示性能退化的问题。
  • 通过选择性关注高频细节并保留低频结构信息,提升图像分类中的特征学习能力。
  • 设计一种仅在高频域内运作的频率感知注意力机制,以最小化对主干特征结构的干扰。
  • 在标准基准数据集上,验证所提出的WA模块在多种主干网络架构上的有效性。
  • 证明通过DWT实现的频域注意力可提升小样本数据集上的模型泛化能力并减少过拟合。

提出的方法

  • 该方法利用离散小波变换(DWT)将特征图分解为低频和高频分量,从而将结构内容与细节及噪声信息分离。
  • 引入小波注意力(WA)模块,仅对高频分量应用可学习的注意力权重,增强相关细节信息,同时保持低频分量不变。
  • WA模块采用可学习的注意力机制,根据高频特征的重要性自适应地重新校准其表示,从而在不改变主干结构特征的前提下提升表征能力。
  • WA-CNN将WA模块集成到VGG、ResNet和MobileNetV2等现有CNN主干网络中,支持使用标准优化策略进行端到端训练。
  • 模型在CIFAR-10和CIFAR-100数据集上采用标准数据增强(随机裁剪、翻转)和余弦退火学习率调度策略进行训练。
  • 注意力处理后通过逆向DWT完成特征重建,确保与标准CNN层和训练流程的兼容性。

实验结果

研究问题

  • RQ1通过DWT实现的频域分解是否能通过分离高频分量中的噪声与细节,提升基于CNN的图像分类的鲁棒性与准确性?
  • RQ2仅在高频域应用注意力机制是否能在不损害低频分量主干结构信息的前提下,增强特征表示能力?
  • RQ3在小样本数据集上,WA-CNN与标准注意力机制(如SE、CBAM)相比,在准确率与泛化能力方面表现如何?
  • RQ4WA模块是否能无需大规模架构调整,有效集成到多种CNN架构中?
  • RQ5WA-CNN是否通过滤除高频噪声而保留有意义的边缘与纹理细节,从而在小样本数据集上减少过拟合?

主要发现

  • 在CIFAR-10基准上,WA-CNN相较于MobileNetV2实现了1.26%的Top-1准确率提升,在CIFAR-100上提升了1.54%。
  • 在VGG16bn上,WA模块在CIFAR-10上达到93.89%的最高Top-1准确率,在CIFAR-100上达到73.66%,优于所有基线模型和基于注意力的模型。
  • 在前80个训练周期内,WA模块使VGG16bn的训练损失相比基线降低约0.2,表明收敛速度更快且更稳定。
  • WA模块在所有测试主干网络(VGG、ResNet、MobileNetV2)中均持续提升性能,尤其在轻量化模型如MobileNetV2上提升最为显著。
  • 与SE、CBAM、ECA等其他注意力机制相比,WA模块在多数设置下表现更优,尤其在大型网络中优势明显。
  • 可视化结果表明,WA-CNN提升了对相似或细粒度图像的识别能力,表明其具备更强的判别能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。