Skip to main content
QUICK REVIEW

[论文解读] Revisiting Dynamic Convolution via Matrix Decomposition

Yunsheng Lou, Yinpeng Chen|arXiv (Cornell University)|Mar 15, 2021
Advanced Neural Network Applications参考文献 31被引用 12
一句话总结

本文提出动态卷积分解(DCD),一种基于矩阵分解的方法,通过在低维潜在空间中用动态通道融合替代通道组上的动态注意力机制,将动态卷积中的参数量减少50%,同时在MobileNetV2和ResNet上实现了更高的准确率与更优的训练收敛性。

ABSTRACT

Recent research in dynamic convolution shows substantial performance boost for efficient CNNs, due to the adaptive aggregation of K static convolution kernels. It has two limitations: (a) it increases the number of convolutional weights by K-times, and (b) the joint optimization of dynamic attention and static convolution kernels is challenging. In this paper, we revisit it from a new perspective of matrix decomposition and reveal the key issue is that dynamic convolution applies dynamic attention over channel groups after projecting into a higher dimensional latent space. To address this issue, we propose dynamic channel fusion to replace dynamic attention over channel groups. Dynamic channel fusion not only enables significant dimension reduction of the latent space, but also mitigates the joint optimization difficulty. As a result, our method is easier to train and requires significantly fewer parameters without sacrificing accuracy. Source code is at https://github.com/liyunsheng13/dcd.

研究动机与目标

  • 解决由于K重核参数化导致的动态卷积参数量过高与训练不稳定的难题。
  • 克服动态注意力与静态卷积核联合优化的困难。
  • 通过矩阵分解重构动态卷积,揭示根本原因:通道组注意力导致的高维潜在空间。
  • 提出一种更紧凑且可训练的替代方案,即在低维潜在空间中实现动态通道融合。
  • 在不显著增加计算成本的前提下,实现更高的模型效率与准确率。

提出的方法

  • 通过矩阵分解重构动态卷积:W(x) = W₀ + UΠ(x)SVᵀ,其中Π(x)在高维空间中对K×C个通道组施加动态注意力。
  • 识别出通道组上的动态注意力导致高维潜在空间(KC个通道),从而引发注意力值过小,学习效果差。
  • 提出动态通道融合(DCF),在低维潜在空间(L ≪ C)中使用完整动态矩阵Φ(x),通过PΦ(x)Qᵀ实现通道融合。
  • 利用两个可学习矩阵P和Q对输入(Qᵀx ∈ ℝᴸ)进行压缩,对输出(P ∈ ℝᶜˣᴸ)进行扩展,从而减少参数量并稳定训练。
  • 引入通道自适应的动态注意力Λ(x)与残差缩放B以增强模型控制力与效率。
  • 在逐点卷积与分类器层中完整实现DCF与Λ(x),在深度可分离卷积中仅使用DCF以保持紧凑性。

实验结果

研究问题

  • RQ1为何尽管性能有所提升,动态卷积仍面临训练收敛性差与参数量过高的问题?
  • RQ2由通道组注意力引发的高维潜在空间如何影响模型优化与参数效率?
  • RQ3在低维潜在空间中实现的动态通道融合,是否能在准确率与参数效率上超越通道组上的动态注意力?
  • RQ4矩阵分解在多大程度上能揭示现有动态卷积方法的结构局限性?
  • RQ5融合矩阵Φ(x)的动态行为在不同网络层与输入数据中如何变化?

主要发现

  • 在MobileNetV2 ×1.0上,DCD相比Chen et al. (2020c)减少50%参数量,相比Yang et al. (2019)减少75%,且MAdds未增加。
  • 在ResNet-18上,DCD仅使用Chen et al. (2020c) 33%的参数量,同时实现0.4%的top-1准确率提升。
  • DCD收敛速度更快,准确率高于DY-Conv(Chen et al., 2020c),即使未进行大规模温度调优。
  • 在MobileNetV2 ×0.5与×1.0上,推理时间增加12–14%,但由此带来的3.2–4.8% top-1准确率增益使其合理。
  • 动态系数的归一化方差σΦ在深层网络中增大,表明高层特征具有更强的动态适应能力。
  • 消融实验表明,结合动态通道融合、通道自适应注意力Λ(x)与完整残差B=1可获得最优性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。