[论文解读] Assessing the Benchmarking Capacity of Machine Reading Comprehension Datasets
本文提出一种半自动化的、基于消融分析的方法,用于评估机器阅读理解(MRC)数据集是否真正衡量高级语言理解能力。通过系统性地移除与特定语言技能(如内容词、句子顺序或词性标注)相关的特征,研究发现强基线模型在仅保留内容词和打乱词序的版本上分别达到原始性能的89.2%和78.5%,表明大多数现有MRC问题依赖于表层线索而非深层理解。
Existing analysis work in machine reading comprehension (MRC) is largely concerned with evaluating the capabilities of systems. However, the capabilities of datasets are not assessed for benchmarking language understanding precisely. We propose a semi-automated, ablation-based methodology for this challenge; By checking whether questions can be solved even after removing features associated with a skill requisite for language understanding, we evaluate to what degree the questions do not require the skill. Experiments on 10 datasets (e.g., CoQA, SQuAD v2.0, and RACE) with a strong baseline model show that, for example, the relative scores of a baseline model provided with content words only and with shuffled sentence words in the context are on average 89.2% and 78.5% of the original score, respectively. These results suggest that most of the questions already answered correctly by the model do not necessarily require grammatical and complex reasoning. For precise benchmarking, MRC datasets will need to take extra care in their design to ensure that questions can correctly evaluate the intended skills.
研究动机与目标
- 为解决MRC数据集在衡量真正语言理解能力方面缺乏系统性评估的问题。
- 探究现有MRC问题是否需要复杂推理或语法理解,还是可通过表面模式解决。
- 开发一种可扩展的半自动化方法,基于必要技能评估MRC数据集的基准能力。
- 识别当前数据集设计中的缺陷,这些缺陷使得模型无需掌握预期的NLU能力即可取得成功。
提出的方法
- 提出一种半自动化的基于消融的方法,系统性地修改输入文本和问题,以移除与特定语言技能相关的特征。
- 定义了12项必要技能,分为阅读和推理两大类,如指代消解、时间推理和词汇蕴涵等。
- 应用输入消融技术,包括词汇匿名化、句子重排和词性(POS)标注,以测试模型对扰动的鲁棒性。
- 使用强基线模型(如基于BERT的模型)在消融后的输入上评估性能,并将相对得分与原始性能进行比较。
- 通过人工标注评估消融特征的可重构性及其对正确答案的必要性,区分特征是否可猜测或真正必需。
- 在两种回答风格下分析10个现有MRC数据集(如CoQA、SQuAD v2.0、RACE),包括抽取式和多项选择题。
实验结果
研究问题
- RQ1现有MRC数据集在多大程度上需要深层语言理解(如指代消解或因果推理)才能正确回答问题?
- RQ2在移除内容词、句子顺序或词性标注后,强基线模型是否仍能解决MRC问题,表明其依赖于表层模式?
- RQ3消融特征(如功能词、词序)是否可由人类重构?它们是否对正确答案真正必要?
- RQ4在消融输入上的相对性能得分在多大程度上反映了MRC数据集评估复杂NLU能力的基准能力?
- RQ5应遵循哪些设计原则,以确保MRC数据集能有效评估预期的语言理解能力?
主要发现
- 平均而言,当仅保留在上下文和问题中的内容词时,基线模型的F1得分达到原始得分的89.2%,表明其在表层线索上表现强劲。
- 当句子中的词被打乱后,模型性能下降至原始得分的78.5%,表明词序和句法结构并非正确答案的必要条件。
- 在句子顺序被重排的情况下,性能为原始得分的95.4%,表明句子级句法结构通常并非模型成功的关键因素。
- 人工标注显示,对于大多数问题,被消融的特征(如功能词)无法被重构,即使可猜测,也并非正确答案所必需。
- 未发现任何问题属于Case δ(可重构且必需的特征),表明大多数问题无需深层语言理解即可解决。
- 综合结果表明,许多现有MRC问题不足以评估复杂的语言理解能力,因为模型可通过模式匹配而非真正理解来取得成功。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。