Skip to main content
QUICK REVIEW

[论文解读] A Review of Winograd Schema Challenge Datasets and Approaches

Vid Kocijan, Thomas Lukasiewicz|arXiv (Cornell University)|Apr 23, 2020
Topic Modeling参考文献 43被引用 20
一句话总结

本文综述了Winograd Schema Challenge(WSC)数据集与方法,分析了Wsc273和Wsc285等基准数据集,并评估了BERT和RoBERTa等神经网络方法的微调表现。主要发现是,最先进模型在Wsc273上的准确率接近90%,表明神经网络可通过统计模式解决WSC,而非真正的常识推理,从而挑战了该任务‘防谷歌搜索’的原始主张。

ABSTRACT

The Winograd Schema Challenge is both a commonsense reasoning and natural language understanding challenge, introduced as an alternative to the Turing test. A Winograd schema is a pair of sentences differing in one or two words with a highly ambiguous pronoun, resolved differently in the two sentences, that appears to require commonsense knowledge to be resolved correctly. The examples were designed to be easily solvable by humans but difficult for machines, in principle requiring a deep understanding of the content of the text and the situation it describes. This paper reviews existing Winograd Schema Challenge benchmark datasets and approaches that have been published since its introduction.

研究动机与目标

  • 分析Winograd Schema Challenge基准数据集的设计、结构及其演变,包括Wsc273、Wsc285及多语言变体。
  • 评估基于神经网络的模型(尤其是BERT和RoBERTa)在WSC及相关共指消解数据集上的表现。
  • 探究现代语言模型是通过真正的常识推理还是通过数据中的统计偏差来解决WSC的。
  • 评估数据集特征(如关联性、可切换性及去偏处理)对模型性能的影响。
  • 识别现有方法的局限性,并提出需要更稳健、更具探测性的基准用于常识推理评估。

提出的方法

  • 系统性回顾100个原始Winograd模式及后续数据集,包括Wsc273、Wsc285、Dpr、Wnli、Pdp和WinoGrande。
  • 将Wsc273示例分类为关联型(13.6%)和可切换型(48%)子集,以评估模型偏差与一致性。
  • 使用掩码语言建模和下一句预测任务,在Dpr和WSC数据集上对BERT和RoBERTa模型进行微调。
  • 应用专门的预训练方法,如AMS(对齐、掩码、选择)和WikiCREM,以提升共指消解性能。
  • 在Wsc273、Wnli、Pdp和Dpr上评估模型表现,并对WinoGrande的去偏版本进行消融研究。
  • 分析模型在可切换示例和验证集上的行为,以检测对数据集偏差的利用。

实验结果

研究问题

  • RQ1现代神经网络模型在多大程度上通过统计模式而非真正的常识推理来解决Winograd Schema Challenge?
  • RQ2数据集特征(如关联性和可切换性)如何影响模型性能与泛化能力?
  • RQ3在大规模掩码共指数据集上进行预训练是否能提升下游WSC基准的表现?
  • RQ4为何某些模型在Wsc273上表现优异,却在可切换或去偏示例上缺乏鲁棒性?
  • RQ5在WSC上取得高分对NLP中常识推理评估的未来发展有何启示?

主要发现

  • 表现最佳的模型(如在WinoGrande上微调的RoBERTa)在Dpr上达到93.1%准确率,在Wsc273上达到90.1%,在Pdp上达到87.5%,表明其在标准基准上表现强劲。
  • RoBERTa在WinoGrande上达到79.1%准确率,在Wsc273上达到90.1%的准确率,为迄今在Wsc273上报告的最高结果,表明大规模预训练的影响。
  • 在WinoGrande去偏数据上训练的模型在验证集上仅达到随机水平表现,表明其在完整WinoGrande数据集上取得的高准确率可能源于对数据集偏差的利用,而非真正推理。
  • 约48%的Wsc273示例为可切换型,即代词指代可被反转并保持有效,而模型在候选对象切换时往往表现不一致。
  • 约13.6%的Wsc273示例为关联型,其中正确答案与词语关联紧密(如‘roof’→‘repaired’),模型在这些样本上的表现显著优于非关联型情况。
  • 尽管在WSC基准上准确率很高,模型并未表现出可靠的常识推理或叙事理解能力,如在生成连贯文本或回答日常情境简单问题时出现失败。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。