[论文解读] An Empirical Study on Robustness to Spurious Correlations using Pre-trained Language Models
本文研究了像 BERT 这类预训练语言模型为何在 NLP 任务中对虚假相关性表现出鲁棒性。研究发现,这种鲁棒性源于对少数反例的泛化能力,这些反例打破了主导启发式规则;当此类反例稀缺时,通过辅助任务进行多任务学习(MTL)能显著提升鲁棒性,从而增强对少数样本的泛化能力,同时不损害分布内性能。
Recent work has shown that pre-trained language models such as BERT improve robustness to spurious correlations in the dataset. Intrigued by these results, we find that the key to their success is generalization from a small amount of counterexamples where the spurious correlations do not hold. When such minority examples are scarce, pre-trained models perform as poorly as models trained from scratch. In the case of extreme minority, we propose to use multi-task learning (MTL) to improve generalization. Our experiments on natural language inference and paraphrase identification show that MTL with the right auxiliary tasks significantly improves performance on challenging examples without hurting the in-distribution performance. Further, we show that the gain from MTL mainly comes from improved generalization from the minority examples. Our results highlight the importance of data diversity for overcoming spurious correlations.
研究动机与目标
- 理解预训练语言模型在 NLP 任务中对虚假相关性表现出鲁棒性的机制。
- 探究数据多样性(尤其是打破虚假模式的少数样本)在提升模型泛化能力方面的作用。
- 评估当反例极其稀少时,多任务学习(MTL)是否能提升鲁棒性。
- 评估 MTL 是否真正提升了对少数样本的泛化能力,而不仅仅是分布内性能。
- 通过证明 MTL 在独立同分布(i.i.d.)设置下仍具有效用,挑战其收益有限的假设,特别是在分布外泛化方面。
提出的方法
- 作者分析了在自然语言推理(MNLI)和释义识别(QQP)数据集上微调的预训练模型(BERT、RoBERTa),比较其在标准测试集和挑战性(对抗性)测试集上的表现。
- 通过移除违反虚假相关性的反例(例如,词语重叠度高但无蕴含关系),隔离少数样本的影响,并测量其在挑战性数据集上的性能下降。
- 采用多任务学习(MTL),引入旨在提升对罕见反事实样本泛化能力的辅助任务,如具有反转模式的释义或 NLI 风格数据。
- 通过调整预训练数据规模、模型大小和微调轮次,评估其对鲁棒准确率的影响。
- 通过比较在分布内(MNLI、QQP)和分布外(HANS、PAWS_QQP)测试集上的表现,分离出鲁棒性增益。
- 使用统计显著性检验并报告标准差,以验证多次运行结果的可靠性。
实验结果
研究问题
- RQ1为何预训练语言模型能更好地泛化到违反虚假相关性的挑战性、分布外样本?
- RQ2训练数据中少数反例的存在在多大程度上促进了预训练模型的鲁棒性?
- RQ3当反例极其稀少时,多任务学习(MTL)是否能在不损害分布内性能的前提下提升鲁棒性?
- RQ4MTL 的提升是否源于对少数样本更好的泛化能力,还是源于其他归纳偏置?
- RQ5模型规模、预训练数据量和微调时长如何影响对虚假相关性的鲁棒性?
主要发现
- 预训练模型的鲁棒准确率更高(例如,BERT_LARGE 在 HANS 上为 71.4%),而从零开始训练的模型则较低(BERT_SCRATCH 为 49.9%),主要归因于对罕见反例的泛化能力。
- 移除打破虚假相关性的少数反例会导致鲁棒准确率显著下降(例如,HANS 上从 62.5% 降至 49.9%),证明其关键作用。
- 当反例极其稀少时,采用辅助任务的多任务学习(MTL)可使 HANS 上的鲁棒准确率提升高达 12.6 个百分点(从 53.8% 提升至 62.5%),且不损害分布内性能。
- MTL 的增益归因于对少数样本泛化能力的提升,而非仅模型容量或归纳偏置。
- 更大的模型规模、更多的预训练数据以及更长的微调时间进一步提升了鲁棒准确率,尤其在少数样本稀缺时更为显著。
- 模型在 HANS 和 PAWS_QQP 上的表现差异表明,当前的挑战性数据集可能尚未涵盖所有类型的分布偏移,凸显了构建更全面评估体系的必要性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。