[论文解读] Bridging the Gap between Language Model and Reading Comprehension: Unsupervised MRC via Self-Supervision
该论文提出了一种自监督框架,用于无监督机器阅读理解(MRC),通过引入一种新颖的掩蔽前缀任务——Spotting-MLM,弥合了预训练语言模型(PLMs)与MRC之间的差距。该方法在无标注数据下训练模型识别并复制文档中的答案片段。通过推理阶段的问题重写提升鲁棒性,在标准MRC基准上实现最先进性能,在对抗性数据集上相比数据合成基线最高提升34.7 F1分。
Despite recent success in machine reading comprehension (MRC), learning high-quality MRC models still requires large-scale labeled training data, even using strong pre-trained language models (PLMs). The pre-training tasks for PLMs are not question-answering or MRC-based tasks, making existing PLMs unable to be directly used for unsupervised MRC. Specifically, MRC aims to spot an accurate answer span from the given document, but PLMs focus on token filling in sentences. In this paper, we propose a new framework for unsupervised MRC. Firstly, we propose to learn to spot answer spans in documents via self-supervised learning, by designing a self-supervision pretext task for MRC - Spotting-MLM. Solving this task requires capturing deep interactions between sentences in documents. Secondly, we apply a simple sentence rewriting strategy in the inference stage to alleviate the expression mismatch between questions and documents. Experiments show that our method achieves a new state-of-the-art performance for unsupervised MRC.
研究动机与目标
- 为解决MRC模型对大规模人工标注数据集(如SQuAD)的依赖问题。
- 弥合预训练语言模型(PLMs)(在掩蔽填空任务上预训练)与MRC(需要上下文敏感的跨度定位)之间的差距。
- 开发一种自监督方法,无需任何人工标注或合成训练数据,直接学习跨度定位能力。
- 通过推理阶段的表达式不匹配缓解策略,提升无监督MRC的鲁棒性。
- 证明自监督学习可与数据合成方法互补,在标注数据有限时进一步提升性能。
提出的方法
- 提出Spotting-MLM,一种自监督前缀任务:在文档中重复出现的信息跨度被掩蔽,模型需从同一文档中复制正确的跨度以填补空白。
- 该任务要求建模句子间的深层交互,因为模型必须定位并检索语义相关的跨度,而非仅预测单个token。
- 在推理阶段,将问题重写为陈述句,以与未标注文本的训练分布对齐,减少表达式不匹配。
- 该框架使用标准的Transformer模型(如BERT)进行微调,仅基于未标注文本语料库完成自监督Spotting-MLM任务。
- 通过在合成MRC数据上微调自监督模型,将该方法与数据合成技术结合,进一步提升性能。
- 该方法避免使用模板化或数据驱动的问题生成,转而依赖自监督机制,直接从原始文本中学习跨度定位。
实验结果
研究问题
- RQ1自监督前缀任务是否能在无任何标注数据的情况下,有效学习上下文敏感的跨度定位能力,用于无监督MRC?
- RQ2在推理阶段将问题重写为陈述句,是否能减少表达式不匹配,提升无监督MRC的鲁棒性?
- RQ3与数据合成基线相比,所提出的自监督方法在标准和对抗性MRC基准上的性能与鲁棒性如何?
- RQ4在低资源设置下,自监督模型能否与合成数据有效结合,进一步提升性能?
- RQ5自监督预训练在多大程度上可减少对大规模人工标注MRC数据集的依赖?
主要发现
- 所提出的自监督方法在无监督MRC上实现了新的最先进性能,在对抗性数据集上相比数据合成基线最高提升34.7 F1分。
- 在SQuAD和NewsQA数据集上,该方法分别取得78.8/86.8和71.0/78.8的EM/F1分数,显著优于现有无监督基线。
- 在对抗性数据集上,该方法相比最佳基线分别提升26.0和34.7 F1分,展现出卓越的鲁棒性。
- 在低资源设置下,仅用1%的标注训练数据微调自监督模型,即可达到平均71.0的F1分数,优于在相同数据上微调的BERT。
- 将自监督模型与数据合成技术结合,可进一步提升性能,表明两种方法具有互补性。
- 推理阶段的句子重写策略显著提升泛化能力,有效缓解问题与文档间表达式不匹配的影响。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。