[论文解读] Robust low-rank training via approximate orthonormal constraints
本文提出了一种鲁棒的低秩训练方法,通过在低秩权重矩阵上施加近似正交约束,维持模型的准确率和效率,同时提升对抗鲁棒性。通过将梯度流投影到低秩流形上,并将奇异值限制在狭窄区间内,该方法确保了有界的条件数,显著增强了鲁棒性,且计算成本仅与标准低秩训练相当。
With the growth of model and data sizes, a broad effort has been made to design pruning techniques that reduce the resource demand of deep learning pipelines, while retaining model performance. In order to reduce both inference and training costs, a prominent line of work uses low-rank matrix factorizations to represent the network weights. Although able to retain accuracy, we observe that low-rank methods tend to compromise model robustness against adversarial perturbations. By modeling robustness in terms of the condition number of the neural network, we argue that this loss of robustness is due to the exploding singular values of the low-rank weight matrices. Thus, we introduce a robust low-rank training algorithm that maintains the network's weights on the low-rank matrix manifold while simultaneously enforcing approximate orthonormal constraints. The resulting model reduces both training and inference costs while ensuring well-conditioning and thus better adversarial robustness, without compromising model accuracy. This is shown by extensive numerical evidence and by our main approximation theorem that shows the computed robust low-rank network well-approximates the ideal full model, provided a highly performing low-rank sub-network exists.
研究动机与目标
- 解决低秩神经网络中模型效率与对抗鲁棒性之间的权衡问题。
- 阐明为何低秩分解会降低鲁棒性,将其与奇异值爆炸和高条件数联系起来。
- 开发一种训练算法,在保持低秩结构的同时强制奇异值有界,以改善网络的条件数。
- 从理论上证明,若存在具有有界奇异值的理想低秩模型,则该方法可近似求解该模型。
- 通过实证结果表明,该方法在多种架构和数据集上均能保持或提升准确率与鲁棒准确率。
提出的方法
- 通过神经网络的条件数建模鲁棒性,将鲁棒性差的原因归因于低秩矩阵中奇异值无界导致的高条件数。
- 利用流形上的几何积分方法,为低秩因子 $U$、$S$ 和 $V$ 分别推导出三种独立的投影梯度流。
- 通过将低秩矩阵的奇异值约束在围绕目标值 $s$ 的狭窄区间 $[s - \varepsilon, s + \varepsilon]$ 内,实现近似正交性。
- 采用连续时间梯度流公式,并通过正交投影 $P(Y)$ 将其投影到低秩流形 $\mathcal{M}_r$ 的切空间上,以保持流形结构。
- 应用微分不等式框架,界定计算解 $Y(t)$ 与理想低秩路径 $\widetilde{W}(t)$ 之间的误差,证明在有界扰动下 $\|Y(t) - W(t)\| \leq 3t\eta$。
- 利用一阶近似定理证明,若存在一个具有有界奇异值的高性能低秩网络,则该方法可将其以小误差近似计算出来。
实验结果
研究问题
- RQ1为何低秩神经网络相比全秩模型表现出更低的对抗鲁棒性?
- RQ2是否可以在不牺牲模型准确率或增加训练成本的前提下,使低秩训练具备鲁棒性?
- RQ3对低秩因子施加近似正交约束在多大程度上能改善条件数并从而提升鲁棒性?
- RQ4在何种条件下,所提方法可近似求解具有有界奇异值的最优低秩模型?
- RQ5在多种架构和数据集上,该方法在准确率、鲁棒准确率和计算效率方面与现有基线相比表现如何?
主要发现
- 所提方法实现了具有有界奇异值的鲁棒低秩训练,显著提升了对抗鲁棒性,且未牺牲准确率。
- 实证评估表明,该鲁棒低秩网络在多个数据集和架构上达到或超过全秩模型的鲁棒准确率。
- 通过利用低秩分解,该方法降低了训练和推理成本,同时通过约束奇异值维持了有界的条件数。
- 理论分析证实,若存在一个具有有界奇异值的高性能低秩网络,则该算法可将其以一阶近似误差计算出来。
- 计算模型与理想低秩路径之间的误差被限制在 $3t\eta$ 以内,确保了在投影梯度流下的稳定性和收敛性。
- 该方法适用于前馈网络,并可通过将卷积核重塑为矩阵的方式扩展至卷积层,与以往低秩方法一致。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。