[论文解读] Detecting Memorization in ReLU Networks
本文提出一种新方法,通过在单类输入批次上对深层激活使用非负矩阵分解(NMF)来测量其非线性程度,从而检测ReLU神经网络中的记忆化现象。该方法揭示了深层激活的高非线性与记忆化之间存在强相关性,且通过追踪NMF压缩性能的曲线下方面积(AuC),可实现有效的早期停止。
We propose a new notion of `non-linearity' of a network layer with respect to an input batch that is based on its proximity to a linear system, which is reflected in the non-negative rank of the activation matrix. We measure this non-linearity by applying non-negative factorization to the activation matrix. Considering batches of similar samples, we find that high non-linearity in deep layers is indicative of memorization. Furthermore, by applying our approach layer-by-layer, we find that the mechanism for memorization consists of distinct phases. We perform experiments on fully-connected and convolutional neural networks trained on several image and audio datasets. Our results demonstrate that as an indicator for memorization, our technique can be used to perform early stopping.
研究动机与目标
- 提出一种对权重缩放等可逆变换具有鲁棒性的、可靠的、基于激活的记忆化指标,用于深层ReLU网络。
- 探究通过激活矩阵的非负矩阵分解(NMF)测量的深层非线性是否与泛化性能差相关。
- 评估所提方法是否可作为训练过程中的实用早期停止准则,以防止过拟合。
- 对比NMF、主成分分析(PCA)和随机消融在基于压缩的鲁棒性度量中对记忆化检测的敏感性。
提出的方法
- 将ReLU层相对于输入批次的非线性定义为其与线性系统的接近程度,通过激活矩阵的非负秩量化。
- 对单类批次的激活矩阵应用近似非负矩阵分解(NMF),在一系列近似秩 $k$ 上估计非线性程度。
- 通过测量NMF压缩激活的准确率与 $k$ 的曲线下方面积(AuC)来评估鲁棒性并检测记忆化。
- 通过计算各自的AuC曲线并评估与泛化误差的相关性,对比NMF、PCA和随机消融技术。
- 进行逐层分析,追踪训练过程中网络中非线性程度的演变。
- 将单类NMF的AuC用作实时信号,在记忆化开始时触发早期停止。
实验结果
研究问题
- RQ1通过激活矩阵的非负秩测量的深层ReLU层非线性,能否作为记忆化的可靠指标?
- RQ2单类与多类输入批次的激活非线性有何差异?这揭示了关于记忆化的何种信息?
- RQ3与PCA或随机消融相比,基于NMF的非线性度量是否与泛化误差具有更强的相关性?
- RQ4基于NMF的AuC曲线能否用于检测训练过程中记忆化的发生,并实现有效的早期停止?
主要发现
- 在单类批次上使用NMF测量的深层激活高非线性,是记忆化的强指标,尤其与多类批次相比更为显著。
- 在CIFAR-10数据集上,基于NMF的AuC曲线与泛化误差的皮尔逊相关系数为 -0.82,优于PCA(-0.64)和随机消融(-0.61)。
- NMF AuC曲线的峰值几乎与测试损失的局部最小值完全对齐,表明该方法能以高精度检测到过拟合的起始点。
- 该方法在图像和音频数据集上训练的全连接网络与卷积网络中,均能成功识别记忆化现象。
- 逐层分析显示,记忆化以分阶段方式发生,随着训练进行,深层的非线性显著增加。
- 所提出的基于NMF的方法可实现有效的早期停止,因为AuC曲线在测试误差开始上升前达到最大值。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。