[论文解读] Neural Network Memorization Dissection
本文提出一种基于梯度的方法,用于区分深度神经网络(DNNs)在训练过程中所学习的内容与所记忆的内容。通过分析梯度幅值并使用基于生成对抗网络(GAN)的优化方法比较所学特征,作者发现DNNs始终以一致的方式学习简单、共享的模式(一种学习方式),但通过高度多变、模型特定的路径记忆单个训练样本(N种记忆方式),尤其是在标签随机的情况下。
Deep neural networks (DNNs) can easily fit a random labeling of the training data with zero training error. What is the difference between DNNs trained with random labels and the ones trained with true labels? Our paper answers this question with two contributions. First, we study the memorization properties of DNNs. Our empirical experiments shed light on how DNNs prioritize the learning of simple input patterns. In the second part, we propose to measure the similarity between what different DNNs have learned and memorized. With the proposed approach, we analyze and compare DNNs trained on data with true labels and random labels. The analysis shows that DNNs have extit{One way to Learn} and extit{N ways to Memorize}. We also use gradient information to gain an understanding of the analysis results.
研究动机与目标
- 理解DNNs在训练过程中如何优先学习简单输入模式。
- 开发一种测量不同DNNs所学内容与记忆内容之间相似性的方法。
- 比较在真实标签与随机标签数据上训练的DNNs的学习与记忆行为。
- 探究不同DNN架构与随机初始化是否导致一致的学习函数或发散的记忆模式。
提出的方法
- 梯度幅值 $ \overline{G} $ 通过计算所有训练输入的梯度绝对值的平均值得到,用于追踪训练过程中的学习动态。
- 使用基于GAN的优化方法生成输入模式 $ \boldsymbol{x}^{j*} $,以最大化每个类别的激活,代表模型所学习的内容。
- 使用公式2衡量模型间的差异性,该公式计算不同模型生成的优化模式之间的平均距离。
- 模型在真实标签($ \mathbb{X}^{T} $)和随机标签($ \mathbb{X}^{R} $)数据集上进行训练,以比较学习与记忆行为。
- 该方法使用梯度上升优化潜在码 $ \boldsymbol{z} $,生成反映DNN内部表征的图像 $ G(\boldsymbol{z}) $。
- 实验比较了使用不同随机种子、架构(VGG11、VGG13、ResNet32)以及数据噪声水平训练的模型,以评估其一致性与发散性。
实验结果
研究问题
- RQ1在标签随机的情况下,DNNs在早期训练中如何优先学习简单模式?
- RQ2当在真实标签上训练时,DNN的所学函数在不同随机初始化与架构下是否具有高度一致性?
- RQ3在相同随机标签数据集上,使用不同初始化训练的DNNs其记忆模式有何差异?
- RQ4梯度动态与DNNs中学习与记忆现象的出现之间存在何种关系?
- RQ5随着标签噪声增加,不同模型之间所学函数与记忆表征的相似性如何变化?
主要发现
- 在真实标签上训练的DNNs表现出一致的训练轨迹与梯度动态,表明存在一种稳定的学习共享模式的方式。
- 在真实标签上训练的模型在其所学特征上表现出极低的差异性(图3中的蓝条),证实无论初始化或架构如何,它们都会收敛到相似的内部表征。
- 相比之下,在随机标签上训练的模型表现出高度差异性(图3中的黄条),表明存在N种不同的方式来记忆单个训练样本。
- 梯度幅值 $ \overline{G} $ 在拟合阶段急剧上升,在随机标签训练中存在明显的“搜索阶段”,而在真实标签训练中则为直接拟合,反映出不同的优化动态。
- 即使使用权重衰减和数据增强,随机标签上训练的DNNs的记忆模式在不同运行之间仍保持高度可变性,进一步证实了“N种记忆方式”的现象。
- 随着标签噪声增加,DNNs所学函数的相似性逐步降低,表明其正从学习向记忆转变。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。