[论文解读] Back to Square One: Bias Detection, Training and Commonsense Disentanglement in the Winograd Schema
本文揭示了Winograd Schema(WS)评估中的关键缺陷,提出了一种类比句子评估方法及两种新基线,暴露了数据集中的偏差。研究证明,最先进语言模型在零样本WS类任务中表现随机,表明WS基准上看似取得的进步更多源于有监督数据中的模式,而非真正的常识推理。
The Winograd Schema (WS) has been proposed as a test for measuring commonsense capabilities of models. Recently, pre-trained language model-based approaches have boosted performance on some WS benchmarks but the source of improvement is still not clear. We begin by showing that the current evaluation method of WS is sub-optimal and propose a modification that makes use of twin sentences for evaluation. We also propose two new baselines that indicate the existence of biases in WS benchmarks. Finally, we propose a method for evaluating WS-like sentences in a zero-shot setting and observe that popular language models perform randomly in this setting. We conclude that much of the apparent progress on WS may not necessarily reflect progress in commonsense reasoning, but much of it comes from supervised data, which is not likely to account for all the required commonsense reasoning skills and knowledge.
研究动机与目标
- 揭示当前Winograd Schema评估方法中的缺陷,这些缺陷可能扭曲模型能力的评估。
- 通过新型基线模型识别并量化现有WS基准中的偏差。
- 提出一种基于类比句子的改进评估框架,以实现更可靠的常识推理评估。
- 评估预训练语言模型在零样本设置下是否真正具备常识推理的泛化能力。
提出的方法
- 提出一种类比句子评估方法,以提高Winograd Schema基准评估的可靠性。
- 引入两种新基线,利用WS数据集中存在的语言学和统计偏差。
- 设计一种零样本评估协议,用于WS类句子,以检验模型在微调模式之外的泛化能力。
- 利用这些方法评估WS基准中性能提升是否源于常识推理,还是数据驱动的启发式方法。
- 在新评估设置中使用标准预训练语言模型(如BERT、RoBERTa)测量零样本性能。
- 通过分析模型在多种WS变体上的预测结果,检测其是否依赖表面线索而非真正推理。
实验结果
研究问题
- RQ1当前Winograd Schema评估方法在多大程度上掩盖了模型对数据集偏差的依赖?
- RQ2新基线能否暴露现有WS基准中的系统性偏差?
- RQ3最先进语言模型在零样本WS类设置中是否展现出真正的常识推理能力?
- RQ4报告的WS基准性能提升中有多少可归因于有监督数据模式而非推理能力?
- RQ5采用类比句子的改进评估框架能否提供更可靠的常识能力评估?
主要发现
- 标准Winograd Schema评估方法欠佳,且容易掩盖模型偏差。
- 两种新基线成功利用了数据集偏差,表明当前基准对这类模式缺乏鲁棒性。
- 主流预训练语言模型在所提出的零样本评估设置中表现随机,表明其在常识推理方面缺乏真正的泛化能力。
- WS基准上观察到的性能提升主要源于有监督数据模式,而非真正的常识理解。
- 类比句子评估方法通过减少模糊性和偏差,提高了常识推理评估的可靠性。
- 本研究结论认为,WS基准中大部分进展并未反映常识推理能力的提升,而更多是训练数据中归纳偏差的结果。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。