Skip to main content
QUICK REVIEW

[论文解读] Backpropagation-Friendly Eigendecomposition

Wei Wang, Zheng Dang|arXiv (Cornell University)|Jun 21, 2019
Algorithms and Data Compression参考文献 21被引用 16
一句话总结

本文提出了一种数值稳定且可微分的特征分解方法,适用于深度学习,其前向传播采用SVD,反向传播则使用幂迭代法计算梯度。该方法实现了鲁棒的ZCA白化,并引入了PCA去噪作为新型归一化层,在CIFAR-10上相比批量归一化和标准特征分解方法,在稳定性和准确性方面表现更优。

ABSTRACT

Eigendecomposition (ED) is widely used in deep networks. However, the backpropagation of its results tends to be numerically unstable, whether using ED directly or approximating it with the Power Iteration method, particularly when dealing with large matrices. While this can be mitigated by partitioning the data in small and arbitrary groups, doing so has no theoretical basis and makes its impossible to exploit the power of ED to the full. In this paper, we introduce a numerically stable and differentiable approach to leveraging eigenvectors in deep networks. It can handle large matrices without requiring to split them. We demonstrate the better robustness of our approach over standard ED and PI for ZCA whitening, an alternative to batch normalization, and for PCA denoising, which we introduce as a new normalization strategy for deep networks, aiming to further denoise the network's features.

研究动机与目标

  • 解决在深度网络中对特征分解进行反向传播时的数值不稳定性问题,特别是在特征值接近或矩阵较大时。
  • 克服标准SVD和幂迭代方法的局限性,后者在梯度爆炸或对初始化和迭代次数敏感方面表现不佳。
  • 实现在不进行任意通道划分的前提下进行满秩特征分解,从而保留模型容量和理论一致性。
  • 引入PCA去噪作为新型归一化策略,以去除无关的特征噪声并提升分类性能。
  • 证明所提出的混合方法在训练稳定性与误差率方面优于标准SVD、幂迭代法或批量归一化。

提出的方法

  • 在前向传播中使用SVD计算精确的特征向量和特征值,确保前向计算的数值稳定性。
  • 在反向传播中将SVD结果用作幂迭代的初始化,以计算梯度。
  • 通过幂迭代而非解析SVD导数来计算梯度,避免在特征值接近时出现不稳定性。
  • 通过幂迭代步数限制梯度大小,即使在特征值接近退化时也能防止梯度爆炸。
  • 使用基于Python的自动微分在PyTorch中实现反向传播,前向传播则依赖于稳定的SVD分解。
  • 根据保留的方差或固定数量动态调整保留的特征向量数量,实现灵活的PCA去噪。

实验结果

研究问题

  • RQ1结合SVD与幂迭代的混合特征分解方法,是否能在特征值接近退化的情况下实现深度网络中的稳定反向传播?
  • RQ2所提出的方法在基于特征分解的层中,是否在训练稳定性和收敛性方面优于标准SVD和幂迭代法?
  • RQ3在新特征分解方法支持下,PCA去噪是否可作为深度网络中批量归一化的有效替代方案?
  • RQ4幂迭代步数如何影响该框架中梯度计算的准确性和稳定性?
  • RQ5在分类任务中,保留不同比例方差对PCA去噪层性能有何影响?

主要发现

  • 使用PCA去噪的模型在CIFAR-10上的平均测试误差为4.63% ± 0.11,优于批量归一化(4.81% ± 0.19)。
  • 在PCA去噪层中保留99%的方差时性能最佳,误差率为4.63% ± 0.11。
  • 在反向传播中仅使用2次幂迭代即达到近似最优性能(误差率4.63%),与29次迭代的结果非常接近。
  • 该方法展现出更优的训练稳定性,损失曲线平滑;而标准幂迭代法表现出显著不稳定性且最终误差更高。
  • 基于标准SVD的反向传播在5次试验中有5次因梯度爆炸导致NaN值而失败,而所提方法始终保持稳定。
  • PCA去噪层在保留8至32个特征向量的范围内均保持一致性能,最优性能出现在16个特征向量时(保留约99.9%的方差)。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。