[论文解读] Investigating Prior Knowledge for Challenging Chinese Machine Reading Comprehension
本论文提出了C3,这是首个基于真实汉语作为第二语言考试的自由格式多项选择题中文机器阅读理解数据集,要求整合文本内容与多种先验知识(语言学、领域特定、通用世界知识)。尽管最先进模型的准确率已达68.5%,但与人类表现(96.0%)相比仍有显著差距,凸显了先验知识的关键作用以及从英文MRC数据集进行数据增强的局限性。
Machine reading comprehension tasks require a machine reader to answer questions relevant to the given document. In this paper, we present the first free-form multiple-Choice Chinese machine reading Comprehension dataset (C^3), containing 13,369 documents (dialogues or more formally written mixed-genre texts) and their associated 19,577 multiple-choice free-form questions collected from Chinese-as-a-second-language examinations. We present a comprehensive analysis of the prior knowledge (i.e., linguistic, domain-specific, and general world knowledge) needed for these real-world problems. We implement rule-based and popular neural methods and find that there is still a significant performance gap between the best performing model (68.5%) and human readers (96.0%), especially on problems that require prior knowledge. We further study the effects of distractor plausibility and data augmentation based on translated relevant datasets for English on model performance. We expect C^3 to present great challenges to existing systems as answering 86.8% of questions requires both knowledge within and beyond the accompanying document, and we hope that C^3 can serve as a platform to study how to leverage various kinds of prior knowledge to better understand a given written or orally oriented text. C^3 is available at https://dataset.org/c3/.
研究动机与目标
- 开发一个反映第二语言考试实际阅读理解需求的自由格式多项选择题中文MRC数据集。
- 分析该数据集中回答问题所需先验知识的类型与作用——包括语言学、领域特定以及通用世界知识。
- 评估干扰项可信度与使用翻译的英文MRC数据集进行数据增强对模型性能的影响。
- 识别尽管神经网络模型取得进展,中文MRC中仍存在的关键挑战。
- 为未来在多语言与跨语言机器阅读理解中利用先验知识的研究提供基准。
提出的方法
- C3源自真实汉语作为第二语言考试,包含13,369篇文档(对话与混合体裁文本)和19,577道自由格式多项选择题。
- 该数据集包含两个子任务:${\text{C}}_{\text{D}}^{3}$用于基于对话的理解,${\text{C}}_{\text{M}}^{3}$用于正式书面的混合体裁文本。
- 先验知识类型经过系统标注并分类为语言学、领域特定知识,以及八种子类型的一般世界知识(如因果关系、隐含意义、算术等)。
- 通过计算干扰项词语与文档之间的相似度得分$\mathcal{S}(w_i, d)$来量化干扰项可信度,以$\max_i \mathcal{S}(w_i, d)$作为难度的代理指标。
- 在C3上微调神经网络模型(包括BERT、Co-Matching和BERT-wwm-ext),以评估其在不同类型知识需求问题上的表现。
- 通过使用Google Translate将英文MRC数据集(RACE和DREAM)翻译成中文,并与C3训练数据合并,实现数据增强。
实验结果
研究问题
- RQ1C3数据集中回答问题所需的知识类型及其比例是什么?不同文档类型之间有何差异?
- RQ2干扰项可信度与中文MRC中问题难度及模型表现的相关性如何?
- RQ3使用翻译的英文MRC数据集进行数据增强在多大程度上能提升C3基准上的性能?
- RQ4尽管采用了最先进模型与数据增强,为何C3上的性能仍显著低于人类水平?
- RQ5不同类型先验知识(如语言学知识与世界知识)如何影响模型行为与错误模式?
主要发现
- C3中86.8%的问题需要超出文档内容的知识,其中57.3%需要通用世界知识,表明其复杂度较高。
- 表现最佳的模型(BERT-wwm-ext)准确率为68.5%,而人类读者准确率为96.0%,揭示了显著的性能差距。
- 干扰项可信度与模型难度强相关:当最可信的干扰项与文档高度相似时,模型表现显著下降。
- 使用RACE和DREAM中94k条翻译后的英文实例进行数据增强,仅将准确率提升4.6%(从67.8%提升至72.4%),表明迁移能力有限。
- 在C3和英文MRC数据上同时微调多语言BERT,性能为63.4%,低于仅在C3上微调中文BERT的65.7%,表明跨语言迁移效果不佳。
- 当正确答案在文档中未明确提及($\mathcal{S}(c,d)$较低)时,通用世界知识变得至关重要;当干扰项与文档高度相似($\max_i \mathcal{S}(w_i,d)$较高)时,语言学知识更为关键。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。