Skip to main content
QUICK REVIEW

[论文解读] Dataset for the First Evaluation on Chinese Machine Reading Comprehension

Yiming Cui, Ting Liu|arXiv (Cornell University)|Sep 25, 2017
Topic Modeling参考文献 11被引用 9
一句话总结

本文介绍了首个大规模中文机器阅读理解(CMRC-2017)数据集,包含通过自动方法生成的填空式训练数据,以及人工标注的验证集和测试集,涵盖填空式与自然用户查询式阅读理解任务。该数据集支持了基准评估,并涌现出强大的神经网络基线模型,例如 AoA Reader 在隐藏测试集上达到 51.53% 的 F1 分数,充分证明其在推动中文 MRC 研究方面的价值。

ABSTRACT

Machine Reading Comprehension (MRC) has become enormously popular recently and has attracted a lot of attention. However, existing reading comprehension datasets are mostly in English. To add diversity in reading comprehension datasets, in this paper we propose a new Chinese reading comprehension dataset for accelerating related research in the community. The proposed dataset contains two different types: cloze-style reading comprehension and user query reading comprehension, associated with large-scale training data as well as human-annotated validation and hidden test set. Along with this dataset, we also hosted the first Evaluation on Chinese Machine Reading Comprehension (CMRC-2017) and successfully attracted tens of participants, which suggest the potential impact of this dataset.

研究动机与目标

  • 通过创建多样化、面向社区的基准,解决中文阅读理解数据集在规模和质量上的不足。
  • 支持中文机器阅读理解模型的开发与评估,尤其针对低资源及类低资源场景。
  • 举办首次官方中文 MRC 评估(CMRC-2017),促进社区参与与模型对比。
  • 同时提供填空式与自然语言用户查询式阅读理解任务,以反映真实世界中的理解需求。
  • 发布四个官方基线模型与一个隐藏测试集,确保评估的公平性与可复现性。

提出的方法

  • 填空式训练数据通过将儿童读物中的命名实体或内容词替换为空白自动生成。
  • 为填空式与用户查询式两个赛道分别创建了人工标注的验证集与测试集,以确保高质量、自然的问答对。
  • 用户查询赛道的问题更具自然性与开放性,相比填空格式更贴近真实用户行为。
  • 实现了四种基线系统:随机猜测、最高频词选择、AS Reader 与 AoA Reader,其超参数均与原始工作保持一致。
  • 在用户查询赛道中,通过交叉验证与增加 dropout 的方式应用迁移学习与领域自适应技术,以缓解分布偏移问题。
  • 评估通过公开竞赛形式进行,采用隐藏测试集,确保模型性能评估的无偏性。

实验结果

研究问题

  • RQ1现有神经阅读理解模型在新发布的、大规模中文填空式 MRC 数据集上的表现如何?
  • RQ2人工标注的测试集能否提升中文等低资源语言中 MRC 评估的可靠性与有效性?
  • RQ3中文中,填空式与自然语言用户查询式阅读理解任务的模型性能有何差异?
  • RQ4迁移学习与领域自适应在多大程度上能提升模型在分布外用户查询数据上的泛化能力?
  • RQ5在中文 MRC 基准上,无需微调的强基线模型(如 AoA Reader)能否超越参赛者自定义模型?

主要发现

  • AoA Reader 基线在用户查询赛道的隐藏测试集上达到 51.53% 的 F1 分数,优于所有参赛系统。
  • 填空赛道中表现最佳的单模型参赛系统未能超越 ECNU 的集成模型,凸显了集成方法的重要性。
  • 用户查询赛道的参赛系统性能显著低于填空赛道(例如 F1 为 49.07%),表明训练数据与测试数据之间存在显著的领域差异。
  • 最高频词基线在验证集上达到 10.65% 的 F1 分数,表明在低资源设置下,简单启发式方法亦可作为强有力的基线。
  • ECNU 集成系统在用户查询测试集上达到 69.53% 的 F1 分数,证明了模型集成在领域自适应中的有效性。
  • 数据集与竞赛的发布成功吸引了超过 30 名参与者,验证了其在中文 NLP 社区中的相关性与影响力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。