[论文解读] Understanding Rare Spurious Correlations in Neural Networks
本文研究了神经网络如何学习罕见的虚假相关性——即仅在少数训练样本中出现的模式——并证明即使只有一个此类样本也能引发强烈且有害的相关性。研究表明,这些相关性会损害隐私和测试准确率,并提出通过输入噪声和ℓ₂正则化来缓解,该方法显著减少了虚假学习,且无需对数据或模型结构做任何假设。
Neural networks are known to use spurious correlations such as background information for classification. While prior work has looked at spurious correlations that are widespread in the training data, in this work, we investigate how sensitive neural networks are to rare spurious correlations, which may be harder to detect and correct, and may lead to privacy leaks. We introduce spurious patterns correlated with a fixed class to a few training examples and find that it takes only a handful of such examples for the network to learn the correlation. Furthermore, these rare spurious correlations also impact accuracy and privacy. We empirically and theoretically analyze different factors involved in rare spurious correlations and propose mitigation methods accordingly. Specifically, we observe that $\ell_2$ regularization and adding Gaussian noise to inputs can reduce the undesirable effects. Code available at https://github.com/yangarbiter/rare-spurious-correlation.
研究动机与目标
- 理解神经网络在仅少数训练样本中出现虚假相关性时,是否以及如何学习这些相关性。
- 研究罕见虚假相关性对模型隐私(通过成员推断攻击衡量)以及在分布偏移下的测试准确率的影响。
- 开发并评估不依赖于数据或模型结构假设的通用缓解策略。
- 将成员推断攻击与对抗鲁棒性关于罕见虚假模式的见解相衔接。
- 提供理论和实证证据,表明即使对罕见虚假模式的最小暴露,也可能导致显著的模型漏洞。
提出的方法
- 在目标类别的一小部分训练图像中引入虚假模式(例如,彩色背景),生成‘虚假样本’。
- 在修改后的数据集上训练神经网络,并使用定义的虚假相关性得分来衡量虚假相关性的强度。
- 利用理论简化模型,分析虚假样本比例与信噪比变化下虚假相关性学习的相变行为。
- 通过成员推断攻击评估隐私风险,衡量攻击者区分虚假训练样本与测试数据的能力。
- 通过测量干净测试准确率和在测试集中加入模式后的虚假测试准确率,评估在分布偏移下的测试准确率。
- 测试缓解策略:输入高斯噪声注入、ℓ₂正则化(权重衰减)和梯度裁剪,比较其有效性。
实验结果
研究问题
- RQ1当虚假样本占比达到何种阈值(例如,每60,000个样本中仅1个)时,神经网络开始学习并表现出强烈的虚假相关性?
- RQ2罕见虚假相关性如何影响模型隐私,其脆弱性是否可通过成员推断攻击衡量?
- RQ3罕见虚假相关性如何影响测试准确率,特别是在虚假模式占优势的分布偏移下?
- RQ4哪些正则化技术能有效缓解罕见虚假相关性的负面影响,且不依赖于特定应用的假设?
主要发现
- 仅在60,000个样本中包含一个虚假样本进行训练的神经网络,其虚假相关性得分显著高于基线,表明已发展出强烈的虚假相关性学习。
- 虚假样本在成员推断攻击下表现出更高的脆弱性,证实罕见虚假模式可能导致隐私泄露。
- 干净测试准确率基本保持稳定,但在分布偏移下虚假测试准确率急剧下降,表明当此类模式变得普遍时,虚假相关性会损害模型性能。
- 输入高斯噪声注入和ℓ₂正则化能有效降低虚假相关性强度,同时提升隐私保护和鲁棒性,而梯度裁剪未表现出显著优势。
- 理论分析揭示,随着虚假样本比例从零开始增加,虚假相关性学习存在明显的相变,表明存在模型记忆化的临界阈值。
- 不同虚假模式和模型架构表现出不同的敏感度,表明虚假相关性诱导的有效性取决于数据集和模型特性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。