Skip to main content
QUICK REVIEW

[论文解读] Delving Deeper into Anti-aliasing in ConvNets

Xueyan Zou, Fanyi Xiao|arXiv (Cornell University)|Aug 21, 2020
Digital Media Forensic Detection参考文献 32被引用 21
一句话总结

本文提出了一种在卷积神经网络中内容感知的自适应低通滤波层,通过预测空间和通道自适应的滤波权重,在下采样过程中抑制混叠效应。通过学习位置和通道特定的模糊处理,该方法在ImageNet、COCO和Cityscapes基准上提升了准确率和位移一致性,相较于固定滤波基线方法性能更优,且计算开销极低。

ABSTRACT

Aliasing refers to the phenomenon that high frequency signals degenerate into completely different ones after sampling. It arises as a problem in the context of deep learning as downsampling layers are widely adopted in deep architectures to reduce parameters and computation. The standard solution is to apply a low-pass filter (e.g., Gaussian blur) before downsampling. However, it can be suboptimal to apply the same filter across the entire content, as the frequency of feature maps can vary across both spatial locations and feature channels. To tackle this, we propose an adaptive content-aware low-pass filtering layer, which predicts separate filter weights for each spatial location and channel group of the input feature maps. We investigate the effectiveness and generalization of the proposed method across multiple tasks including ImageNet classification, COCO instance segmentation, and Cityscapes semantic segmentation. Qualitative and quantitative results demonstrate that our approach effectively adapts to the different feature frequencies to avoid aliasing while preserving useful information for recognition. Code is available at https://maureenzou.github.io/ddac/.

研究动机与目标

  • 为解决卷积神经网络中因下采样导致的混叠问题,该问题会引起位移敏感性与性能下降。
  • 克服固定低通滤波器(如高斯模糊)的局限性,后者对所有区域和通道进行均匀模糊,造成信息损失。
  • 开发一种自适应滤波机制,根据局部内容频率和通道特异性特征模式动态调节模糊强度。
  • 通过引入新的位移一致性评估指标,提升语义分割任务中对输入位移的鲁棒性。
  • 在图像分类、语义分割、实例分割以及域泛化任务中均实现良好泛化能力。

提出的方法

  • 提出一种可学习的自适应低通滤波层,可为每个空间位置和通道组预测滤波权重。
  • 使用轻量级MLP头从输入特征图中预测滤波系数,实现空间与通道自适应。
  • 将预测的滤波器作为可学习核的动态2D卷积,其核在空间位置和通道间动态变化。
  • 采用可微分的滤波操作,可无缝集成至标准卷积神经网络架构中,无需修改网络结构。
  • 通过通道分组机制同时实现空间与通道自适应,为每组通道独立预测滤波器。
  • 使用滤波过程的可微分近似,支持端到端训练与反向传播。

实验结果

研究问题

  • RQ1自适应、内容感知的滤波是否能比固定低通滤波更有效地减少卷积神经网络中的混叠?
  • RQ2空间与通道自适应滤波如何影响语义与实例分割任务中的位移一致性?
  • RQ3所提方法是否在不增加模型容量的前提下,提升图像分类与分割基准上的性能?
  • RQ4该自适应滤波在抑制噪声的同时,多大程度上保留了如边缘等高频特征?
  • RQ5通道组数量对自适应滤波机制的性能与泛化能力有何影响?

主要发现

  • 在ResNet-18上,该方法在ImageNet上达到68.0%的Top-1准确率,优于ResNet(66.5%)和高斯模糊基线(66.7%)。
  • 该方法将位移一致性提升至80.9%,显著高于ResNet(79.1%)和高斯模糊(79.8%),证明其对输入位移具有更强鲁棒性。
  • 增加通道组数量可提升准确率,但当组数达到8组时趋于饱和,表明进一步增加收益递减。
  • 该方法在仅增加4.5%参数量(ResNet-101)的情况下,准确率提升0.3%,优于单纯增加网络容量。
  • 定性结果表明,在Cityscapes语义分割中,该方法边缘保留效果更优,道路与电线杆轮廓更清晰,优于基线方法。
  • 可视化结果证实,模型能通过在轮廓处施加更强模糊来“扩展”边缘,从而在下采样后保留结构细节。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。