[论文解读] SWAG: A Large-Scale Adversarial Dataset for Grounded Commonsense Inference
本文提出了 Swag,一个大规模的对抗性数据集,包含 113,000 个基于视频字幕生成的常识推理样本,采用对抗性过滤方法消除标注伪影。该方法结合语言模型生成的反事实样本与一组风格分类器,构建去偏见的多项选择题,人类准确率达到 88%,而最先进模型的准确率不足 60%,凸显了 NLP 系统在该任务上的显著挑战。
Given a partial description like "she opened the hood of the car," humans can reason about the situation and anticipate what might come next ("then, she examined the engine"). In this paper, we introduce the task of grounded commonsense inference, unifying natural language inference and commonsense reasoning. We present SWAG, a new dataset with 113k multiple choice questions about a rich spectrum of grounded situations. To address the recurring challenges of the annotation artifacts and human biases found in many existing datasets, we propose Adversarial Filtering (AF), a novel procedure that constructs a de-biased dataset by iteratively training an ensemble of stylistic classifiers, and using them to filter the data. To account for the aggressive adversarial filtering, we use state-of-the-art language models to massively oversample a diverse set of potential counterfactuals. Empirical results demonstrate that while humans can solve the resulting inference problems with high accuracy (88%), various competitive models struggle on our task. We provide comprehensive analysis that indicates significant opportunities for future research.
研究动机与目标
- 为解决 NLP 数据集中普遍存在的标注伪影和人类偏见问题,这些伪影会误导模型依赖于风格线索而非真正推理。
- 开发一种可扩展的自动化方法,用于构建高质量、去偏见的基础常识推理数据集。
- 创建一个基准测试,通过要求模型进行物理和情境推理而非仅语言蕴含,来挑战最先进模型。
- 证明当前模型在基础常识任务上表现显著不足,尽管人类表现优异。
提出的方法
- 从 ActivityNet 和 LSMDC 收集 113,000 对视频字幕,形成上下文-动词短语对,用于多项选择推理。
- 使用微调过的最先进语言模型大规模过采样多样且合理的反事实(错误)动词短语结尾。
- 应用对抗性过滤(AF):训练一组风格分类器以识别并过滤掉具有偏见语言模式的结尾。
- 通过在过滤后的数据上重新训练分类器,迭代优化数据集,以消除风格伪影,同时保留语义合理性。
- 通过众包验证最终过滤后的反事实样本,确保其质量和多样性。
- 构建一个平衡的数据集,每个上下文包含四个选项:一个正确选项,三个去偏见、经对抗性过滤的反事实选项。
实验结果
研究问题
- RQ1对抗性过滤能否有效减少大规模常识推理数据集中存在的标注伪影?
- RQ2Swag 数据集在多大程度上暴露了当前 NLP 模型在基础常识推理方面的局限性?
- RQ3人类在基础常识推理任务上的表现与最先进模型相比如何?
- RQ4使用语言模型生成的反事实样本是否能提升推理数据集中负样本的鲁棒性和多样性?
主要发现
- 人类在 Swag 数据集上的准确率达到 88%,表明尽管任务复杂,但对人类而言仍具直观性。
- 最先进 NLI 模型在 Swag 上的准确率不足 60%,显示出与人类表现之间的显著差距。
- 对抗性过滤成功减少了风格伪影,证据在于多个分类器无法可靠区分正确与错误选项。
- 该数据集在动词和主题方面具有高度多样性,无单一动词主导分布,表明其对现实世界情境具有广泛覆盖。
- 即使表现最佳的模型(ESIM+ELMo)也经常以高置信度选择错误答案,表明其未能正确推理物理合理性。
- Swag 中动词的累积分布比 MultiNLI 更为均衡,表明尽管基于视频,其领域覆盖范围仍更广。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。