[论文解读] Harmonic Convolutional Networks based on Discrete Cosine Transform
本文提出谐波卷积神经网络,用学习加权组合离散余弦变换(DCT)滤波器的模块替代标准卷积层,利用DCT的能量集中特性实现高效的模型压缩并提升性能。该方法在ImageNet上实现0.7–1.2%的top-1准确率提升,在目标检测任务上实现0.7–1.1 AP提升,在语义分割任务上实现1.1% IoU提升,计算开销极低,并在不同光照条件下表现出优异的泛化能力。
Convolutional neural networks (CNNs) learn filters in order to capture local correlation patterns in feature space. We propose to learn these filters as combinations of preset spectral filters defined by the Discrete Cosine Transform (DCT). Our proposed DCT-based harmonic blocks replace conventional convolutional layers to produce partially or fully harmonic versions of new or existing CNN architectures. Using DCT energy compaction properties, we demonstrate how the harmonic networks can be efficiently compressed by truncating high-frequency information in harmonic blocks thanks to the redundancies in the spectral domain. We report extensive experimental validation demonstrating benefits of the introduction of harmonic blocks into state-of-the-art CNN models in image classification, object detection and semantic segmentation applications.
研究动机与目标
- 通过基于DCT的滤波器学习引入谱先验知识,以提升CNN性能。
- 通过截断高频DCT分量实现高效模型压缩。
- 提升训练收敛速度与泛化能力,尤其在数据有限或光照变化条件下。
- 在图像分类、目标检测和语义分割等多样化视觉任务中实现一致的性能提升。
- 提供一种即插即用的替代方案,可无缝替换标准卷积层,且计算开销极低。
提出的方法
- 用计算DCT滤波特征图响应加权和的谐波模块替代标准卷积层。
- 在局部感受野上应用加窗DCT以提取谱系数,然后学习最优权重以组合这些系数。
- 利用DCT的能量集中特性,通过截断高频谱分量实现模型压缩,同时保持极低的准确率损失。
- 端到端训练谐波网络,允许通过DCT和加权和操作进行反向传播。
- 通过在DCT域重参数化卷积滤波器,实现将预训练标准CNN转换为谐波版本。
- 将谐波模块应用于ResNet、DenseNet和DeepLabV3等先进架构,并对主干网络转换与预训练进行消融研究。
实验结果
研究问题
- RQ1基于DCT的谐波模块是否能在图像分类、目标检测和语义分割等多样化视觉任务中提升性能?
- RQ2将滤波器表示为DCT基函数的加权组合,是否能实现更快的训练收敛速度与更好的泛化能力,尤其在数据稀缺或光照变化条件下?
- RQ3在不造成显著性能下降的前提下,谐波网络在多大程度上可通过截断高频系数实现压缩?
- RQ4在准确率、推理速度和内存占用方面,谐波网络与标准CNN相比表现如何?
- RQ5谐波模块能否在不进行架构大规模重构的前提下,有效集成到ResNet和DeepLabV3等现有CNN架构中?
主要发现
- 在ImageNet数据集上,谐波ResNet-50和ResNet-101相比其标准对应模型,top-1准确率提升0.7–1.2%。
- 在小规模NORB数据集上,谐波网络达到SOTA性能,并在未见光照条件下表现出良好泛化能力。
- 在Pascal VOC和MS COCO目标检测任务中,Faster R-CNN和Mask R-CNN的谐波版本AP提升0.7–1.1分。
- 在Pascal VOC 2012语义分割任务中,以ResNet-101为主干的谐波DeepLabV3相比基线模型,mIoU绝对提升1.1%。
- 谐波模块相比标准卷积仅引入3–7%的计算开销,内存占用相当。
- 在语义分割中,谐波网络在特定类别上表现显著提升,如“chair”类别IoU提升9.5%,“sheep”提升3.9%,“boat”提升3.2%。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。