Skip to main content
QUICK REVIEW

[论文解读] Learnable Discrete Wavelet Pooling (LDW-Pooling) For Convolutional Networks

Bor-Shiun Wang, Jun-Wei Hsieh|arXiv (Cornell University)|Sep 13, 2021
Advanced Neural Network Applications被引用 5
一句话总结

本文提出可学习离散小波池化(LDW-Pooling),一种可微分、可逆的池化层,通过可学习的低通和高通滤波器将2D特征图分解为四个小波子带(LL、LH、HL、HH),实现信息保留的下采样。该方法在CIFAR-10、CIFAR-100和ImageNet上均达到最先进准确率,同时保持计算效率和可逆性,有利于更好的特征恢复。

ABSTRACT

Pooling is a simple but essential layer in modern deep CNN architectures for feature aggregation and extraction. Typical CNN design focuses on the conv layers and activation functions, while leaving the pooling layers with fewer options. We introduce the Learning Discrete Wavelet Pooling (LDW-Pooling) that can be applied universally to replace standard pooling operations to better extract features with improved accuracy and efficiency. Motivated from the wavelet theory, we adopt the low-pass (L) and high-pass (H) filters horizontally and vertically for pooling on a 2D feature map. Feature signals are decomposed into four (LL, LH, HL, HH) subbands to retain features better and avoid information dropping. The wavelet transform ensures features after pooling can be fully preserved and recovered. We next adopt an energy-based attention learning to fine-select crucial and representative features. LDW-Pooling is effective and efficient when compared with other state-of-the-art pooling techniques such as WaveletPooling and LiftPooling. Extensive experimental validation shows that LDW-Pooling can be applied to a wide range of standard CNN architectures and consistently outperform standard (max, mean, mixed, and stochastic) pooling operations.

研究动机与目标

  • 解决标准池化层(如最大池化和平均池化)中存在的信息丢失与不可逆性问题。
  • 开发一种保留空间细节并支持下采样后完整特征恢复的池化机制。
  • 设计一种计算高效、可学习的池化操作,兼容主流CNN架构。
  • 提升细粒度分类与分割任务中的特征表示能力。

提出的方法

  • LDW-Pooling使用可分离的1×K和K×1滤波器分别进行水平与垂直方向的小波变换,确保线性时间复杂度。
  • 通过离散小波变换(DWT)将特征划分为四个子带:LL(低-低)、LH(低-高)、HL(高-低)与HH(高-高),完整保留信息。
  • 引入可学习的能量注意力机制,从子带中选择最具代表性的特征,增强判别能力。
  • 通过保持小波重构特性确保可逆性,支持通过逆向DWT完全恢复原始特征。
  • 该池化层具备可微分与可训练性,其可学习滤波器通过联合损失函数(包含交叉熵损失L_CE与小波约束损失L_wavelet)进行优化。
  • 该结构可无缝集成至现有CNN主干网络(如ResNet、MobileNet-V2与DenseNet)中,无需修改网络架构。

实验结果

研究问题

  • RQ1可学习的小波基池化层是否能在图像分类基准上超越标准池化操作,在准确率与效率方面表现更优?
  • RQ2LDW-Pooling的可逆性是否能提升对需要精细空间细节的任务中的特征恢复能力与性能表现?
  • RQ3与固定池化策略相比,能量注意力机制在特征选择方面有何增强效果?
  • RQ4小波约束损失(L_wavelet)在多大程度上提升了可逆性与跨任务的泛化能力?
  • RQ5LDW-Pooling是否能在无需微调的情况下,泛化至多种CNN架构与数据集?

主要发现

  • 在ResNet18上,LDW-Pooling在ImageNet上达到26.10%的top-1准确率,优于标准最大池化(28.60%)及其他最先进方法。
  • 在ResNet50上,LDW-Pooling在CIFAR-100上的测试误差降低至29.75%,优于最大池化(32.02%)及其他先进池化方法。
  • 消融实验表明,准确率的主要提升源于LDW-Pooling本身,而非能量注意力机制,后者仅带来边际增益。
  • 通过L_wavelet损失显著提升了可逆性,UNet-based重建中PSNR达到33.1,表明具备强大的特征恢复能力。
  • 使用小波约束预训练滤波器可提升收敛速度与性能,尤其在结合L_CE用于分类任务时效果更显著。
  • LDW-Pooling在多种主干网络(包括ResNet、DenseNet与MobileNet-V2)中均表现出良好泛化能力,持续提升准确率与效率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。