[论文解读] Towards Interpreting and Mitigating Shortcut Learning Behavior of NLU Models
该论文提出LTGR,一种新颖的框架,通过将训练数据特征建模为长尾分布,并使用基于知识蒸馏的正则化器来抑制高快捷度样本上的过度自信预测,从而缓解自然语言理解(NLU)模型中的快捷学习问题。实验结果表明,LTGR在三个NLU基准上提升了分布外泛化能力,同时不损害分布内准确率。
Recent studies indicate that NLU models are prone to rely on shortcut features for prediction, without achieving true language understanding. As a result, these models fail to generalize to real-world out-of-distribution data. In this work, we show that the words in the NLU training set can be modeled as a long-tailed distribution. There are two findings: 1) NLU models have strong preference for features located at the head of the long-tailed distribution, and 2) Shortcut features are picked up during very early few iterations of the model training. These two observations are further employed to formulate a measurement which can quantify the shortcut degree of each training sample. Based on this shortcut measurement, we propose a shortcut mitigation framework LTGR, to suppress the model from making overconfident predictions for samples with large shortcut degree. Experimental results on three NLU benchmarks demonstrate that our long-tailed distribution explanation accurately reflects the shortcut learning behavior of NLU models. Experimental analysis further indicates that LTGR can improve the generalization accuracy on OOD data, while preserving the accuracy on in-distribution data.
研究动机与目标
- 解释NLU模型为何依赖快捷特征而非语义理解。
- 识别出快捷特征在训练初期被学习,并集中在长尾特征分布的头部。
- 基于长尾统计信息,为每个训练样本提出一种快捷度的定量度量方法。
- 提出一种缓解框架LTGR,通过知识蒸馏减少模型在高快捷度样本上的过度自信。
- 在保持分布内性能的同时,提升模型在分布外数据上的鲁棒性。
提出的方法
- 使用局部互信息对模型训练集特征进行建模,构建词汇特征的长尾分布。
- 识别出NLU模型倾向于选择长尾分布头部的特征,这些特征对应于不可泛化的快捷方式。
- 通过比较模型注意力与数据集级特征统计量,为每个训练样本定义快捷度度量指标。
- 提出LTGR,一种基于知识蒸馏的正则化器,用于惩罚高快捷度样本上的过度自信预测。
- 对高快捷度样本使用软化标签分布(如均匀分布或类别平衡分布)作为教师信号,以抑制过度自信。
- 通过由交叉熵损失和蒸馏损失加权组合而成的损失函数,将正则化器集成到标准训练中,超参数α控制其权重。
实验结果
研究问题
- RQ1NLU训练数据中词汇特征的长尾分布能否解释快捷学习行为?
- RQ2NLU模型在训练的哪个阶段主要学习快捷特征?
- RQ3能否基于数据集统计信息和模型行为推导出快捷度的定量度量?
- RQ4抑制高快捷度样本上的过度自信是否能提升模型在分布外数据上的泛化能力?
- RQ5所提出的方法能否缓解基于快捷特征的后门攻击?
主要发现
- NLU训练数据中词汇特征的长尾分布能准确解释为何模型偏好快捷特征而非语义理解。
- NLU模型在训练初期的几轮迭代内即学习快捷特征,表明其对高频、不可泛化的模式存在早期且强烈的偏见。
- 所提出的快捷度度量能有效量化每个训练样本对虚假词汇线索的依赖程度。
- LTGR在分布外基准上(如MNLI硬验证集)将准确率提升最高达5.2%,且不降低分布内性能。
- 超参数分析表明,适度正则化(α ≈ 0.5)在分布外泛化与分布内准确率之间达到最佳平衡,避免过度惩罚。
- 初步实验表明,LTGR可通过减少模型对后门触发模式的依赖,部分缓解基于快捷特征的后门攻击。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。