Skip to main content
QUICK REVIEW

[论文解读] DuReaderrobust: A Chinese Dataset Towards Evaluating the Robustness of Machine Reading Comprehension Models.

Hongxuan Tang, Jing Liu|arXiv (Cornell University)|Apr 23, 2020
Topic Modeling参考文献 23被引用 4
一句话总结

本文提出 DuReader_{robust},一个用于评估中文机器阅读理解(MRC)模型在真实文本中对过度敏感性、过度稳定性及泛化能力挑战的鲁棒性表现的中文 MRC 数据集。尽管在标准基准上达到人类水平性能,最先进的预训练 MRC 模型在 DuReader_{robust} 上表现显著下降,凸显了其在真实应用场景中的关键鲁棒性缺陷。

ABSTRACT

Machine Reading Comprehension (MRC) is a crucial and challenging task in natural language processing. Although several MRC models obtains human parity performance on several datasets, we find that these models are still far from robust. To comprehensively evaluate the robustness of MRC models, we create a Chinese dataset, namely DuReader_{robust}. It is designed to challenge MRC models from the following aspects: (1) over-sensitivity, (2) over-stability and (3) generalization. Most of previous work studies these problems by altering the inputs to unnatural texts. By contrast, the advantage of DuReader_{robust} is that its questions and documents are natural texts. It presents the robustness challenges when applying MRC models to real-world applications. The experimental results show that MRC models based on the pre-trained language models perform much worse than human does on the robustness test set, although they perform as well as human on in-domain test set. Additionally, we analyze the behavior of existing models on the robustness test set, which might give suggestions for future model development. The dataset and codes are available at \url{this https URL}

研究动机与目标

  • 解决现有 MRC 模型在标准基准上表现强劲但缺乏鲁棒性评估的问题。
  • 构建一个真实场景测试集,通过自然、现实世界的文本挑战模型在过度敏感性、过度稳定性和泛化能力方面的表现。
  • 提供一个反映真实世界 MRC 应用挑战的基准,超越标准域内性能评估。
  • 分析模型在鲁棒性挑战下的行为表现,为未来模型开发提供指导。
  • 公开发布数据集与代码库,支持中文 MRC 领域可复现的鲁棒性评估。

提出的方法

  • 通过修改现有 DuReader 样本,在保持自然语言的前提下构建新的中文 MRC 数据集 DuReader_{robust},以引入鲁棒性挑战。
  • 设计三个鲁棒性评估维度:过度敏感性(对微小输入扰动的敏感性)、过度稳定性(对无关或冗余文本的容忍度)以及泛化能力(对域外或多样化语境的适应性)。
  • 使用真实、人工撰写的问答对,确保现实适用性,避免先前研究中常见的非自然或人为构造的扰动。
  • 在域内测试集和 DuReader_{robust} 测试集上评估预训练 MRC 模型(如基于 BERT 的模型),比较其性能下降程度。
  • 分析模型在鲁棒性测试集上的失败模式,识别常见失败模式并为未来模型设计提供依据。
  • 通过专用网址公开发布数据集与代码库,支持可复现性与进一步研究。

实验结果

研究问题

  • RQ1最先进的预训练 MRC 模型在基于自然文本的鲁棒性测试集上的表现如何?
  • RQ2MRC 模型在自然中文文本中对微小输入变化的过度敏感性程度如何?
  • RQ3当面对文档中的冗余或无关信息时,模型如何应对过度稳定性问题?
  • RQ4在真实场景中,现有 MRC 模型能否有效泛化到域外或多样化语境?
  • RQ5当前 MRC 模型在自然、具有鲁棒性挑战的示例上表现出的主要失败模式是什么?

主要发现

  • 预训练 MRC 模型在标准域内测试集上达到接近人类水平的性能,但在 DuReader_{robust} 基准上表现显著下降。
  • 模型表现出高度的过度敏感性,对人类可轻松应对的自然文本中微小变化(如问题或文档的轻微变异)容易失效。
  • 当模型忽略相关文本信息或被冗余内容误导时,显示出过度稳定性现象,表明其注意力控制能力较差。
  • 泛化能力表现尤为薄弱,模型在域外或多样化上下文输入上表现困难。
  • 人类与模型在 DuReader_{robust} 上的性能差距显著,表明当前 MRC 系统存在关键的鲁棒性缺陷。
  • 失败分析揭示了模型的一致性行为,如对表面模式的依赖以及在扰动下推理能力有限,提示未来改进方向。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。