[论文解读] CODAH: An Adversarially Authored Question-Answer Dataset for Common Sense
CODAH 引入了一个具有挑战性的对抗性常识问答数据集,其中人类标注者设计问题以专门利用当前最先进神经模型的弱点。尽管在 SWAG 上进行了微调,BERT-Large 在 CODAH 上的准确率仅为 67.5%,而人类表现达到 95.3%,显示出显著差距,揭示了当前模型在真正常识推理能力上的局限性。
Commonsense reasoning is a critical AI capability, but it is difficult to construct challenging datasets that test common sense. Recent neural question answering systems, based on large pre-trained models of language, have already achieved near-human-level performance on commonsense knowledge benchmarks. These systems do not possess human-level common sense, but are able to exploit limitations of the datasets to achieve human-level scores. We introduce the CODAH dataset, an adversarially-constructed evaluation dataset for testing common sense. CODAH forms a challenging extension to the recently-proposed SWAG dataset, which tests commonsense knowledge using sentence-completion questions that describe situations observed in video. To produce a more difficult dataset, we introduce a novel procedure for question acquisition in which workers author questions designed to target weaknesses of state-of-the-art neural question answering systems. Workers are rewarded for submissions that models fail to answer correctly both before and after fine-tuning (in cross-validation). We create 2.8k questions via this procedure and evaluate the performance of multiple state-of-the-art question answering systems on our dataset. We observe a significant gap between human performance, which is 95.3%, and the performance of the best baseline accuracy of 67.5% by the BERT-Large model.
研究动机与目标
- 解决神经网络模型在现有常识基准上表现优异,但缺乏真正人类水平常识推理能力之间的日益扩大的差距。
- 通过对抗性构造问题来靶向模型弱点,开发更稳健的评估基准。
- 创建一个超越现有数据集(如 SWAG)挑战范围的数据集,即使在微调后仍具挑战性。
- 识别当前模型仍难以处理的具体类型常识推理,例如数量推理、否定推理和对象指代。
提出的方法
- 标注者接受预训练语言模型(如 BERT 或 GPT)行为的培训,并被要求生成模型在微调前后均无法正确回答的问题。
- 采用交叉验证程序,仅当问题在初始版本和微调后版本均能欺骗模型时才被接受,从而激励问题具备对抗性质量。
- 数据集采用类似于 SWAG 的句子补全多项选择格式,但问题特地设计以暴露模型的局限性。
- 在保留的测试集(2,800 个问题)上评估性能,模型在 SWAG 上微调前后均进行测试。
- 消融研究比较了仅在 CODAH 上测试与在 SWAG + CODAH 上微调的性能,并评估数据集规模的影响。
- 使用仅答案基线来评估答案层面的特征(如长度、结构)是否对模型性能有贡献。
实验结果
研究问题
- RQ1人类设计的对抗性问题是否能显著缩小当前最先进神经网络模型与人类专家在常识推理任务上的性能差距?
- RQ2现有模型如 BERT 和 GPT-1 是否依赖于答案或上下文中的表面模式,而非深层常识理解?
- RQ3哪些类型的常识推理——数量推理、否定推理、对象指代——对当前模型最具挑战性?
- RQ4在 SWAG 上微调是否能提升模型在新对抗性构建数据集(如 CODAH)上的泛化能力,还是无法弥合性能差距?
- RQ5一种动态数据收集过程,即标注者根据最新模型版本进行适应,是否能产生更稳健且可扩展的基准?
主要发现
- 人类在 CODAH 上的表现为 95.3%,显著高于 SWAG 和 SNLI 上报告的 85.0% 和 87.7%,确认 CODAH 问题需要真正的常识推理。
- 表现最佳的模型 BERT-Large 在 SWAG 上微调后,其在 CODAH 上的准确率仅为 67.5%,表明与人类水平推理之间存在显著差距。
- GPT-1 在交叉验证中于 CODAH 上达到 65.5% 的准确率,而 BERT-Large 在 CODAH 上微调后达到 69.5%,表明即使强模型也难以应对对抗性样本。
- 数量推理问题对 BERT 和 GPT 均构成极大挑战,各类模型准确率均较低,表明在数值常识推理方面存在核心缺陷。
- 仅答案基线的准确率为 52.2%(BERT)和 53.4%(GPT),表明答案层面的模式无法完全解释模型性能,必须依赖常识推理才能区分合理与荒谬的答案。
- 当数据集规模相等时,CODAH 仍比缩小规模后的 SWAG 更具挑战性,尤其对 BERT 而言,性能差距达 7.7%(SWAG 为 75.2%,CODAH 为 67.5%),表明 CODAH 包含更具鲁棒性的难题。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。