[论文解读] Fast Approximation of the Gauss-Newton Hessian Matrix for the Multilayer Perceptron
本文提出了一种用于多层感知机中高斯-牛顿海森矩阵(GNH)逐元素近似的快速蒙特卡洛采样算法,将每项的计算成本从 𝒪(Nn) 降低至 𝒪(n + d/ε²)。该方法实现了高效的层级矩阵(ℋ-)构造。
We introduce a fast algorithm for entry-wise evaluation of the Gauss-Newton Hessian (GNH) matrix for the fully-connected feed-forward neural network. The algorithm has a precomputation step and a sampling step. While it generally requires $O(Nn)$ work to compute an entry (and the entire column) in the GNH matrix for a neural network with $N$ parameters and $n$ data points, our fast sampling algorithm reduces the cost to $O(n+d/ε^2)$ work, where $d$ is the output dimension of the network and $ε$ is a prescribed accuracy (independent of $N$). One application of our algorithm is constructing the hierarchical-matrix (H-matrix) approximation of the GNH matrix for solving linear systems and eigenvalue problems. It generally requires $O(N^2)$ memory and $O(N^3)$ work to store and factorize the GNH matrix, respectively. The H-matrix approximation requires only $O(N r_o)$ memory footprint and $O(N r_o^2)$ work to be factorized, where $r_o \ll N$ is the maximum rank of off-diagonal blocks in the GNH matrix. We demonstrate the performance of our fast algorithm and the H-matrix approximation on classification and autoencoder neural networks.
研究动机与目标
- 为全连接前馈神经网络中的高斯-牛顿海森矩阵(GNH)提出一种快速、可扩展的逐元素评估方法。
- 将GNH矩阵评估的计算成本从 𝒪(Nn) 降低至每项 𝒪(n + d/ε²),且与参数数量 N 无关。
- 实现GNH矩阵的高效层级矩阵(ℋ-矩阵)近似构造,用于求解线性系统与特征值问题。
- 在MNIST和CIFAR-10数据集上的分类网络与自编码器网络中验证该方法的有效性。
- 利用McDiarmid不等式提供采样精度的理论保证,并在数值实验中验证收敛性。
提出的方法
- 提出两阶段算法:预计算阶段存储中间雅可比矩阵与海森矩阵项,采样阶段通过随机采样估计GNH各项。
- 利用GNH矩阵的结构 H = JᵀQJ,其中 J 为网络输出对权重的雅可比矩阵,Q 为损失函数的海森矩阵。
- 使用蒙特卡洛采样通过抽取随机数据点,计算 JᵢᵀQᵢJᵢ 的随机估计值,以近似 H 的各项。
- 应用McDiarmid不等式界定采样误差,确保以高概率收敛至真实的GNH矩阵项。
- 利用采样得到的矩阵项构建GNH的ℋ-矩阵近似,将内存需求从 𝒪(N²) 降低至 𝒪(Nrₒ),分解计算成本从 𝒪(N³) 降低至 𝒪(Nrₒ²),其中 rₒ ≪ N 为非对角块秩。
- 将采样算法集成至ℋ-矩阵构造流程中,实现GNH矩阵的快速且精确的低秩近似。
实验结果
研究问题
- RQ1我们能否显著降低深度神经网络中高斯-牛顿海森矩阵逐项评估的计算成本?
- RQ2基于预计算项的随机采样方法是否能在参数数量 N 上实现次线性依赖的同时保持高精度?
- RQ3所提出的采样方法能否实现GNH矩阵的高效且精确的层级矩阵(ℋ-矩阵)近似?
- RQ4采样误差如何随样本数量与期望精度 ε 的变化而变化?能否建立理论边界?
- RQ5所得到的ℋ-矩阵近似在实际中是否能有效用于求解涉及GNH矩阵的线性系统与特征值问题?
主要发现
- 所提算法将单个GNH矩阵项的评估成本从 𝒪(Nn) 降低至 𝒪(n + d/ε²),在大型网络中实现了显著加速。
- 在MNIST自编码器中,使用10,000个样本,方法实现了1.68%的压缩率,Frobenius误差为6.1×10⁻²,且误差随样本数增加而减小。
- 在CIFAR-10上,ℋ-矩阵近似在使用10,000个样本时实现了4.83%的压缩率,Frobenius误差为7.3×10⁻²,且在高精度下表现良好。
- 随着样本数增加,采样误差收敛至零,且ℋ-矩阵近似误差也随之减小,验证了整体方法的有效性。
- 在相同精度下,该方法所需样本数仅为均匀采样的百分之一,表明其采样效率显著更高。
- 对VGG网络的初步实验表明,该方法可推广至卷积神经网络架构,显示出更广泛的应用潜力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。