Skip to main content
QUICK REVIEW

[论文解读] Orthogonal Convolutional Neural Networks

Jiayun Wang, Yubei Chen|arXiv (Cornell University)|Nov 27, 2019
Advanced Neural Network Applications参考文献 57被引用 7
一句话总结

该论文提出正交卷积神经网络(OCNN),通过卷积核的双重块托普利茨(DBT)矩阵表示,在卷积层中强制实现正交性,确保真正的正交卷积,而不仅仅是核的正交性。该方法在极低计算开销和无额外参数的情况下,提升了训练稳定性、特征多样性以及在图像分类、图像修复和鲁棒性任务中的性能。

ABSTRACT

Deep convolutional neural networks are hindered by training instability and feature redundancy towards further performance improvement. A promising solution is to impose orthogonality on convolutional filters. We develop an efficient approach to impose filter orthogonality on a convolutional layer based on the doubly block-Toeplitz matrix representation of the convolutional kernel instead of using the common kernel orthogonality approach, which we show is only necessary but not sufficient for ensuring orthogonal convolutions. Our proposed orthogonal convolution requires no additional parameters and little computational overhead. This method consistently outperforms the kernel orthogonality alternative on a wide range of tasks such as image classification and inpainting under supervised, semi-supervised and unsupervised settings. Further, it learns more diverse and expressive features with better training stability, robustness, and generalization. Our code is publicly available at https://github.com/samaonline/Orthogonal-Convolutional-Neural-Networks.

研究动机与目标

  • 解决由滤波器相关性和非均匀频谱响应引起的深度CNN训练不稳定与特征冗余问题。
  • 克服仅实现核正交性的局限性,因为核正交性虽必要但不足以实现真正的正交卷积。
  • 提出一种方法,强制卷积层作为线性算子的真正正交性,从而提升频谱均匀性和特征表达能力。
  • 在多种视觉任务中,于监督、半监督和无监督学习设置下均展示一致的性能提升。
  • 确保方法高效,无需额外参数,且训练期间计算成本极低。

提出的方法

  • 将卷积层表示为线性变换,使用双重块托普利茨(DBT)矩阵 $\mathcal{K}$,直接通过 $Y = \mathcal{K}X$ 映射输入 $X$ 到输出 $Y$,保持输入和输出的结构。
  • 通过最小化 $\|\text{Conv}(K,K) - I_r\|$ 强制正交性,其中 $\text{Conv}(K,K)$ 为核的自相关矩阵,确保完整变换为正交。
  • 使用可微损失项 $\mathcal{L}_{\text{orth}} = \|\mathcal{K}\mathcal{K}^T - I\|_F^2$ 在训练过程中正则化DBT矩阵 $\mathcal{K}$,使其趋向正交。
  • 通过超参数 $\lambda$ 引入软正交性约束,平衡主任务损失与正交性正则化损失。
  • 避免核正交性方法中使用的 im2col 变换,实现对输入-输出变换的直接分析,避免因 $Q$ 矩阵导致的频谱失真。
  • 保持与标准CNN相同的参数数量和推理时间,仅在训练时间略有增加(OCNN为9%,核正交基线为3%)。

实验结果

研究问题

  • RQ1核正交性是否足以确保卷积层作为正交线性算子的行为?
  • RQ2通过DBT矩阵强制实现整个卷积变换的正交性,是否能带来更均匀的奇异值谱并提升训练稳定性?
  • RQ3与标准CNN和核正交CNN相比,OCNN是否能减少滤波器相关性与冗余,从而产生更丰富多样的特征?
  • RQ4OCNN在多种视觉任务中,包括监督、半监督和无监督设置下的表现如何?
  • RQ5正交性正则化强度与模型性能之间的最优权衡是什么?其对训练效率有何影响?

主要发现

  • 与标准和核正交基线相比,OCNN在卷积层中实现了更均匀的奇异值谱,后者表现出长尾谱分布,易导致梯度消失。
  • 滤波器相似性直方图显示,OCNN显著降低了成对滤波器的相关性,尤其在深层网络中,从而产生更丰富且冗余更少的特征图。
  • 在CIFAR100上,OCNN相比标准ResNet18和核正交基线分别提升了3%的top-1准确率,最佳性能出现在 $\lambda = 0.1$ 时。
  • 在ImageNet上,OCNN相比标准ResNet34实现了1%的准确率增益,表明在监督图像分类任务中具有持续的性能提升。
  • 在半监督学习中,OCNN在CIFAR100上将准确率提升了3%,表明在监督信息有限的情况下仍具备更强的泛化能力和鲁棒性。
  • 在无监督图像修复任务中,OCNN将PSNR提升了4.3 dB;在图像生成任务中,FID降低了1.3分,表明其在特征质量和生成保真度方面表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。