[论文解读] The Defeat of the Winograd Schema Challenge
本文分析了自然语言处理中常识推理基准Winograd Schema Challenge(WSC)的衰落,表明到2019年,最先进的基于Transformer的模型(尤其是RoBERTa和GPT-3)在WSC273上的准确率已超过90%。作者认为,由于预训练技术的进步、微调策略的成熟以及大规模替代数据集(如WinoGrande)的出现,该挑战实际上已被‘攻克’,模型更多依赖统计模式而非真正的常识理解。
The Winograd Schema Challenge - a set of twin sentences involving pronoun reference disambiguation that seem to require the use of commonsense knowledge - was proposed by Hector Levesque in 2011. By 2019, a number of AI systems, based on large pre-trained transformer-based language models and fine-tuned on these kinds of problems, achieved better than 90% accuracy. In this paper, we review the history of the Winograd Schema Challenge and discuss the lasting contributions of the flurry of research that has taken place on the WSC in the last decade. We discuss the significance of various datasets developed for WSC, and the research community's deeper understanding of the role of surrogate tasks in assessing the intelligence of an AI system.
研究动机与目标
- 分析Winograd Schema Challenge作为人工智能常识推理基准的历史轨迹及其最终失败的原因。
- 探究为何大规模预训练语言模型在WSC上取得高性能,尽管该挑战的设计初衷是测试深层理解与常识知识。
- 考察替代数据集(如WinoGrande和WNLI)在研究焦点转移及实现高准确率方面的作用,而无需真正推理。
- 评估微调、模型规模和数据增强在WSC基准上性能表现中的影响。
- 评估这些结果对AI智能评估未来方向及NLP中替代基准有效性的意义。
提出的方法
- 系统性回顾Winograd Schema Challenge从2011年创立到2019年实现高准确率的历史。
- 分析顶级模型系统所采用的模型架构与训练策略,包括BERT、RoBERTa、GPT-2、GPT-3和T5。
- 评估在WSC类数据上进行微调,以及利用外部知识源(如DPR、ConceptNet和MaskedWiki)的作用。
- 考察替代数据集(如WinoGrande和WNLI)的作用,这些数据集通过数据增强和多任务学习提升了性能。
- 对比不同数据集(WSC273、WNLI、WinoGrande、PDP)的结果,追踪性能趋势与模型演化。
- 识别关键趋势:模型规模持续增大,对微调的依赖增强,研究从少量高质量数据集转向大规模合成数据集。
实验结果
研究问题
- RQ1尽管Winograd Schema Challenge的设计旨在测试深层理解,为何它未能成为常识推理的稳健基准?
- RQ2预训练语言模型在WSC上实现高准确率,在多大程度上依赖统计模式而非真正的常识推理?
- RQ3WinoGrande和WNLI等替代数据集的出现,如何导致原始WSC作为有意义评估工具的衰落?
- RQ4微调和外部知识源在提升模型在WSC基准上表现方面发挥了何种作用?
- RQ5这一结果对AI系统评估以及未来NLP基准设计具有何种更广泛的影响?
主要发现
- 到2019年,基于RoBERTa的模型在WSC273基准上达到90.1%的准确率,超过Levesque设定的人类水平常识推理的90%阈值。
- WinoGrande这一大规模合成数据集的引入,导致研究重点发生转移,大多数后续模型仅在该数据集上评估,而非原始WSC。
- 在WSC类数据上进行微调,特别是结合检索增强方法(如DPR),显著提升了性能,例如He等人(2019)在WSC273上达到75.1%准确率,在WNLI上达到89%。
- GPT-3在未进行任务特定微调的情况下,于WSC273上达到88.3%准确率,表明 few-shot in-context learning 可在该挑战中实现高性能。
- WNLI(一个较小但广泛使用的替代数据集)的准确率从2019年的74.7%上升至2020年的85.6%,表明通过数据和模型规模扩展实现了快速进展。
- 向更大模型(如GPT-3、T5-3B)和在多样化数据集上进行多任务微调(如Khashabi等人,2020)的趋势进一步加速了性能提升,到2021年在WinoGrande上达到91.3%的准确率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。