Skip to main content
QUICK REVIEW

[论文解读] Convolution Aware Initialization

Armen Aghajanyan|arXiv (Cornell University)|Feb 21, 2017
Advanced Neural Network Applications参考文献 16被引用 6
一句话总结

本文提出卷积感知初始化(CAI),一种新颖的权重初始化方法,通过在频域构建正交滤波器,利用频域中卷积与逐元素相乘之间的对偶性。通过应用逆傅里叶变换,CAI在CIFAR10上实现了更快的收敛速度、更高的准确率,并达到最先进性能,且在视觉、自然语言处理和语音任务中均表现出一致的性能提升。

ABSTRACT

Initialization of parameters in deep neural networks has been shown to have a big impact on the performance of the networks (Mishkin & Matas, 2015). The initialization scheme devised by He et al, allowed convolution activations to carry a constrained mean which allowed deep networks to be trained effectively (He et al., 2015a). Orthogonal initializations and more generally orthogonal matrices in standard recurrent networks have been proved to eradicate the vanishing and exploding gradient problem (Pascanu et al., 2012). Majority of current initialization schemes do not take fully into account the intrinsic structure of the convolution operator. Using the duality of the Fourier transform and the convolution operator, Convolution Aware Initialization builds orthogonal filters in the Fourier space, and using the inverse Fourier transform represents them in the standard space. With Convolution Aware Initialization we noticed not only higher accuracy and lower loss, but faster convergence. We achieve new state of the art on the CIFAR10 dataset, and achieve close to state of the art on various other tasks.

研究动机与目标

  • 解决现有初始化方案未考虑卷积算子内在结构的局限性。
  • 探索利用傅里叶变换与卷积之间的对偶性,设计更具表现力和稳定性的卷积滤波器。
  • 开发一种在频域强制正交性的初始化方法,以改善梯度流动性和特征多样性。
  • 通过实证验证CAI在图像分类、情感分析和语音合成等多样化深度学习任务中的有效性。

提出的方法

  • 利用卷积定理,将卷积操作转换为频域中的逐元素相乘。
  • 通过基于期望激活统计量导出的对称矩阵进行特征分解,在频域中构建正交滤波器基。
  • 使用逆傅里叶变换将正交滤波器映射回空间(标准)域,以供卷积层使用。
  • 在逆变换后应用缩放因子以控制最终滤波器权重的幅值。
  • 通过满足从特征分解边界推导出的前提条件,确保最终滤波器的均值为零。
  • 在端到端训练中,将正交初始化应用于非卷积层(如LSTM、全连接层),与CAI结合使用。

实验结果

研究问题

  • RQ1在频域中强制正交性是否能为卷积层带来优于标准方案的初始化效果?
  • RQ2CAI在不同深度学习任务中如何影响训练动态、收敛速度和最终模型准确率?
  • RQ3在缩放前,CAI生成的滤波器幅值和均值的理论边界是什么?
  • RQ4CAI是否在包括CNN、RNN和WaveNet中的空洞卷积在内的多种架构中具有泛化能力?
  • RQ5CAI是否能在无需架构修改的情况下在CIFAR10等标准基准上实现最先进性能?

主要发现

  • 在CIFAR10数据集上,CAI在基础数据增强下实现了94.5%的新最先进测试准确率,超越了先前方法。
  • 在IMDB电影评论数据集上,CAI在Embed-Conv-LSTM架构中达到91.40%的准确率,优于正交(90.31%)、常规(90.16%)和均匀(89.78%)初始化。
  • 在WaveNet语音合成任务中,CAI的分类交叉熵损失为4.771,显著低于正交(4.809)、Glorot(4.810)和常规(4.811)基线。
  • 在所有评估任务中,CAI网络的收敛速度均快于所有基线初始化方案,表明其训练动态得到改善。
  • 理论分析证实,CAI滤波器的幅值是受约束的,且在特征分解的特定条件下可强制实现零均值。
  • CAI在视觉、自然语言处理和语音任务中均表现出一致的性能提升,表明其适用范围广泛,不仅限于单一架构或模态。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。