Skip to main content
QUICK REVIEW

[论文解读] Detailed Dense Inference with Convolutional Neural Networks via Discrete Wavelet Transform

Lingni Ma, Jörg Stückler|arXiv (Cornell University)|Aug 6, 2018
Advanced Neural Network Applications参考文献 22被引用 8
一句话总结

该论文提出WCNN,一种用于密集像素级预测的新型CNN架构,通过使用编码器中缓存的高频小波系数,以逆离散小波变换(iDWT)替代传统反池化操作。通过将DWT/iDWT整合到编码器-解码器框架中,并引入两种小波金字塔变体(LFP和FFC),WCNN在Cityscapes数据集上实现了最先进性能,准确率和计算效率均得到提升,在19类语义分割任务中,相比基线模型最高提升1.2 mIoU,相比FRRN提升1.9 mIoU。

ABSTRACT

Dense pixelwise prediction such as semantic segmentation is an up-to-date challenge for deep convolutional neural networks (CNNs). Many state-of-the-art approaches either tackle the loss of high-resolution information due to pooling in the encoder stage, or use dilated convolutions or high-resolution lanes to maintain detailed feature maps and predictions. Motivated by the structural analogy between multi-resolution wavelet analysis and the pooling/unpooling layers of CNNs, we introduce discrete wavelet transform (DWT) into the CNN encoder-decoder architecture and propose WCNN. The high-frequency wavelet coefficients are computed at encoder, which are later used at the decoder to unpooled jointly with coarse-resolution feature maps through the inverse DWT. The DWT/iDWT is further used to develop two wavelet pyramids to capture the global context, where the multi-resolution DWT is applied to successively reduce the spatial resolution and increase the receptive field. Experiment with the Cityscape dataset, the proposed WCNNs are computationally efficient and yield improvements the accuracy for high-resolution dense pixelwise prediction.

研究动机与目标

  • 为解决基于CNN的密集预测模型在编码器中因池化操作导致的高分辨率空间细节丢失问题。
  • 通过基于小波的特征重建保留细粒度结构信息,提升密集像素级预测(如语义分割)的准确性。
  • 开发一种利用小波分解与CNN池化/反池化之间结构类比的无参数反池化机制。
  • 提出两种小波金字塔变体(LFP与FFC),通过多分辨率DWT/iDWT捕捉全局上下文,增强特征表示。
  • 证明基于小波的反池化与金字塔结构在基准数据集上可稳定超越标准CNN与最先进方法的性能。

提出的方法

  • 通过离散小波变换(DWT)从编码器缓存高频小波系数,并在解码器中利用逆离散小波变换(iDWT)将这些系数与粗粒度特征图结合,实现小波反池化。
  • 利用iDWT联合重建高分辨率特征图,无需可学习参数,从而保留原始输入的空间细节。
  • 提出两种小波金字塔架构:低频传播(LFP)与全频谱组合(FFC),均通过多分辨率DWT提取全局上下文。
  • 在多个阶段应用多尺度DWT/iDWT,逐步降低空间分辨率并增大感受野,模拟层次化特征学习过程。
  • 采用对称的编码器-解码器结构,其中DWT替代池化,iDWT替代反池化,保持与小波多分辨率分析的结构一致性。
  • 采用端到端训练,仅增加存储小波系数的计算开销,不引入额外可学习参数。

实验结果

研究问题

  • RQ1离散小波变换能否有效替代CNN中用于密集预测任务的传统反池化层?
  • RQ2与标准转置卷积或记忆化反池化相比,基于小波的反池化(使用iDWT)是否能提升高分辨率特征图与像素级预测的质量?
  • RQ3小波金字塔变体(LFP与FFC)在捕捉全局上下文与提升分割准确率方面表现如何?
  • RQ4基于小波的反池化与金字塔结构能否在Cityscapes等密集预测基准上实现SOTA性能,且计算成本更低?
  • RQ5多尺度推理与推理时数据增强对小波增强CNN性能的影响如何?

主要发现

  • WCNN-FFC-MS在Cityscapes 19类测试集上达到75.2的mIoU,相比基线FFC-MS提升1.2 mIoU,相比FRRN提升1.9 mIoU。
  • 小波反池化与FFC金字塔的结合带来最大性能增益,在使用多尺度推理时,mIoU相比基线提升6.0点。
  • WCNN各变体在细粒度结构(如围栏、灯柱、交通标志)上的分割准确率持续提升,定性对比结果清晰显示。
  • 所提小波反池化机制为无参数设计,仅需缓存小波系数的内存开销,计算效率高。
  • FFC金字塔在所有指标上均优于LFP金字塔,表明全频谱组合更有利于保留密集预测所需的判别性特征。
  • 尽管在19类mIoU上表现更优(高0.6 mIoU),WCNN-FFC-MS在类别级mIoU上略逊于FRRN(低0.6 mIoU),表明在类别特定泛化能力上存在权衡。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。