Skip to main content
QUICK REVIEW

[论文解读] ReCO: A Large Scale Chinese Reading Comprehension Dataset on Opinion

BingningWang, Ting Yao|arXiv (Cornell University)|Jun 22, 2020
Topic Modeling参考文献 36被引用 4
一句话总结

ReCO 是一个大规模、人工标注的中文阅读理解数据集,包含从真实搜索查询中提取的30万条基于观点的问题。该数据集提供了原始篇章和经过筛选的支持性证据,要求模型具备因果推理和逻辑推理等深层推理能力;尽管基线模型表现强劲,但 BERT 的准确率仅为 77%,远低于人类的 92%,凸显其在机器阅读理解任务中的挑战性。

ABSTRACT

This paper presents the ReCO, a human-curated ChineseReading Comprehension dataset on Opinion. The questions in ReCO are opinion based queries issued to the commercial search engine. The passages are provided by the crowdworkers who extract the support snippet from the retrieved documents. Finally, an abstractive yes/no/uncertain answer was given by the crowdworkers. The release of ReCO consists of 300k questions that to our knowledge is the largest in Chinese reading comprehension. A prominent characteristic of ReCO is that in addition to the original context paragraph, we also provided the support evidence that could be directly used to answer the question. Quality analysis demonstrates the challenge of ReCO that requires various types of reasoning skills, such as causal inference, logical reasoning, etc. Current QA models that perform very well on many question answering problems, such as BERT, only achieve 77% accuracy on this dataset, a large margin behind humans nearly 92% performance, indicating ReCO presents a good challenge for machine reading comprehension. The codes, datasets are freely available at https://github.com/benywon/ReCO.

研究动机与目标

  • 解决现有 MRC 数据集侧重于事实性问题和长而嘈杂文档的局限性。
  • 构建一个大规模、高质量的中文 MRC 数据集,聚焦于搜索引擎中真实世界的问题,且基于观点。
  • 通过提供经过筛选的支持性证据,减少对答案选择的依赖,使模型更关注推理而非检索。
  • 评估需要复杂推理(如因果推理和逻辑推理)的 MRC 任务的难度。
  • 建立一个基准,揭示当前模型与人类在深层文本理解方面的真实性能差距。

提出的方法

  • 从真实用户搜索查询中收集问题,并经过筛选以确保问题可回答为是/否/未知。
  • 众包工作者为每个查询检索 10 篇文档,并从其中一篇中提取出一个相关且具体的支持性证据片段。
  • 标注人员基于证据提供三个候选答案:是、否或不确定,以确保抽象推理能力。
  • 数据集包含完整的篇章和提取出的证据,支持对答案选择与推理的对比分析。
  • 通过严格的质量检查流程,确保数据的高可靠性并减少噪声。
  • 对 BERT、BiDAF 和 ELMo 等模型在 ReCO 上进行微调,其中 BERT 通过在 [CLS] 标记后拼接候选答案,适配为多选分类任务。

实验结果

研究问题

  • RQ1与现有侧重事实性问题的数据集相比,大规模、基于观点的 MRC 数据集若附带筛选后的支持性证据,在推理复杂度上表现如何?
  • RQ2当前的预训练模型(如 BERT)在多大程度上能泛化到需要深层推理的基于观点、非事实性问题?
  • RQ3支持性证据的引入是否能降低答案选择错误的影响,并更准确地隔离模型的推理能力?
  • RQ4当前最先进模型与人类之间的性能差距,如何反映 MRC 任务中推理真实难度?
  • RQ5在该数据集上,当前模型在哪些推理技能(如因果推理或逻辑推理)方面最具挑战性?

主要发现

  • ReCO 数据集包含 300,000 个高质量、人工标注的基于观点的问题,是目前同类中规模最大的中文 MRC 数据集。
  • 当前模型(包括微调后的 BERT)在 ReCO 上的准确率仅为 77%,显著低于人类的 92%。
  • 相对提升指数(RI)显示,ReCO 中模型与人类之间存在显著性能差距,表明其难度较高。
  • 当使用完整篇章而非支持性证据时,模型性能显著下降,证实答案选择仍是主要挑战。
  • BERT 在词汇和句法任务上表现良好,但在因果推理和逻辑推理等深层推理能力上表现吃力,表明需要增强知识整合能力。
  • 错误分析显示,即使经过强大预训练的模型,仍会在需要特定世界知识或复杂推理的问题上失败,凸显了对更复杂推理机制的迫切需求。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。