Skip to main content
QUICK REVIEW

[论文解读] On the Limitations of Dataset Balancing: The Lost Battle Against Spurious Correlations

Roy Schwartz, Gabriel Stanovsky|arXiv (Cornell University)|Apr 27, 2022
Natural Language Processing Techniques被引用 4
一句话总结

本文认为,尽管数据集平衡在减少某些虚假相关性方面有所帮助,但从根本上讲,它无法彻底消除 NLP 中的所有虚假相关性,尤其是在模型变得越来越强大的情况下。文章主张将关注点从大规模微调转向零样本或少样本学习、更丰富的上下文建模以及在不确定情况下的模型拒答,以更好地处理世界知识和常识,同时保留有用的信号。

ABSTRACT

Recent work has shown that deep learning models in NLP are highly sensitive to low-level correlations between simple features and specific output labels, leading to overfitting and lack of generalization. To mitigate this problem, a common practice is to balance datasets by adding new instances or by filtering out "easy" instances (Sakaguchi et al., 2020), culminating in a recent proposal to eliminate single-word correlations altogether (Gardner et al., 2021). In this opinion paper, we identify that despite these efforts, increasingly-powerful models keep exploiting ever-smaller spurious correlations, and as a result even balancing all single-word features is insufficient for mitigating all of these correlations. In parallel, a truly balanced dataset may be bound to "throw the baby out with the bathwater" and miss important signal encoding common sense and world knowledge. We highlight several alternatives to dataset balancing, focusing on enhancing datasets with richer contexts, allowing models to abstain and interact with users, and turning from large-scale fine-tuning to zero- or few-shot setups.

研究动机与目标

  • 挑战数据集平衡能有效消除 NLP 中虚假相关性的假设。
  • 证明即使对单个词特征进行平衡,也无法完全消除所有虚假相关性,原因在于高阶特征交互的存在。
  • 主张过度平衡数据集会损害模型鲁棒性,因为可能丢弃对推理至关重要的世界知识和常识。
  • 倡导采用更丰富的上下文注入、模型拒答以及零样本/少样本学习等替代方法,以提升泛化能力。
  • 质疑大规模微调作为 NLP 主导范式的可持续性和可取性。

提出的方法

  • 通过扩展先前将所有单个词相关性视为虚假的研究,分析数据集平衡的局限性。
  • 证明仅平衡单个特征是不够的,因为虚假相关性源于特征组合,而非单一词项。
  • 提出通过引入更丰富的上下文信息来增强数据集,以编码世界知识和常识,减少对表面线索的依赖。
  • 主张模型应在上下文不足时选择拒答,而非默认依赖虚假相关性。
  • 建议从大规模微调转向零样本或少样本学习设置,以减少对数据集人工制品的过拟合。
  • 建议构建大规模测试集以提升统计功效,更好地评估模型泛化能力,而非依赖小规模测试集。

实验结果

研究问题

  • RQ1即使模型能力不断增强,数据集平衡能否有效消除 NLP 中的所有虚假相关性?
  • RQ2过度平衡数据集的非预期后果是什么,特别是在丢弃有用的世界知识方面?
  • RQ3为何仅平衡单个词特征不足以解决由特征组合引发的虚假相关性?
  • RQ4如何设计模型以应对不确定性,并在上下文模糊时避免默认依赖虚假相关性?
  • RQ5大规模微调是否仍是训练 NLP 模型的最优范式,还是应转向零样本或少样本学习?

主要发现

  • 仅平衡单个词特征不足以消除所有虚假相关性,因为高阶特征交互仍允许模型利用这些相关性。
  • 过度平衡数据集可能移除有意义的信号,包括常识和世界知识,而这些对鲁棒推理至关重要。
  • 在高度平衡的数据集上训练的模型可能无法学习到世界知识事实的备用答案,例如“乔·拜登是美国总统”。
  • 数据集平衡并非缓解社会偏见的万能解法,甚至可能因虚假相关性的复杂性而不足以实现此目的。
  • 当前模型规模与数据集构建之间的军备竞赛是不可持续且适得其反的,因为模型持续利用日益细微的相关性。
  • 转向零样本或少样本学习以及更丰富的上下文建模,为提升模型泛化能力和鲁棒性提供了更可持续且有效的路径。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。