[论文解读] A Self-Training Method for Machine Reading Comprehension with Soft Evidence Extraction
本文提出一种用于机器阅读理解的自训练方法(STM),通过迭代生成并优化基于基础模型预测的软证据标签,在无需黄金标签的情况下提升证据抽取性能。该方法在七项抽取式与非抽取式 MRC 任务的数据集上均取得性能提升,证据抽取准确率显著提高——在 CoQA 上最高提升达 +40%,展现出在多样化 MRC 任务及 BERT 和 RoBERTa 等基础模型上的鲁棒性与泛化能力。
Neural models have achieved great success on machine reading comprehension (MRC), many of which typically consist of two components: an evidence extractor and an answer predictor. The former seeks the most relevant information from a reference text, while the latter is to locate or generate answers from the extracted evidence. Despite the importance of evidence labels for training the evidence extractor, they are not cheaply accessible, particularly in many non-extractive MRC tasks such as YES/NO question answering and multi-choice MRC. To address this problem, we present a Self-Training method (STM), which supervises the evidence extractor with auto-generated evidence labels in an iterative process. At each iteration, a base MRC model is trained with golden answers and noisy evidence labels. The trained model will predict pseudo evidence labels as extra supervision in the next iteration. We evaluate STM on seven datasets over three MRC tasks. Experimental results demonstrate the improvement on existing MRC models, and we also analyze how and why such a self-training method works in MRC. The source code can be obtained from https://github.com/SparkJiao/Self-Training-MRC
研究动机与目标
- 为解决非抽取式 MRC 任务(如 YES/NO 问答和多选 MRC)中黄金证据标签有限或不可用的挑战。
- 开发一种通用且标签高效的改进方法,无需依赖外部资源或人工标注即可提升证据抽取性能。
- 通过自训练实现证据预测的迭代优化,其中前一轮迭代生成的伪标签用于监督后续模型更新。
- 评估该方法在多样化 MRC 任务和基础模型(包括 BERT 和 RoBERTa)上的有效性与稳定性。
- 分析自训练循环中的错误传播与自我修正机制,以确保方法的鲁棒性。
提出的方法
- 该方法采用迭代式自训练循环:在每次迭代中,使用黄金答案和前一轮生成的噪声伪证据标签来训练基础 MRC 模型。
- 伪证据标签由模型在每次训练步骤后自动生成,形成反馈回路,使证据抽取能力随时间逐步提升。
- 证据抽取组件通过这些自动生成的标签进行监督,实现无需人工标注证据的端到端训练。
- 该方法具有通用性,适用于任意 MRC 模型架构(包括 BERT 和 DSQA),并适用于抽取式与非抽取式任务。
- 软证据抽取采用可微注意力机制或跨度预测,生成连续或概率化的证据得分,支持基于梯度的优化。
- 该方法避免使用强化学习和复杂的标签精炼技术,转而依赖稳定、迭代式的伪标签优化。
实验结果
研究问题
- RQ1当缺乏黄金标签时,使用自动生成的伪证据标签进行自训练是否能提升 MRC 中的证据抽取性能?
- RQ2伪标签的迭代优化如何影响证据抽取器与最终答案预测器的性能?
- RQ3自训练循环中错误传播的程度如何?该方法能否从错误预测中实现自我修正?
- RQ4该方法是否能在不同 MRC 任务(包括 YES/NO 问答、多选 MRC 和开放域问答)中实现泛化?
- RQ5STM 在不同基础模型上的表现如何,尤其是在较弱模型(如 BERT-base)与较强模型(如 RoBERTa-large)之间是否存在差异?
主要发现
- 当应用于 RoBERTa-HA 时,STM 在 CoQA 开发集上的证据抽取准确率最高提升 40%,从 13.8% 提升至 19.3%。
- BERT-HA+STM 在 CoQA 和 MultiRC 的所有指标上均优于基础 BERT-HA 模型,显示出在精确率与召回率上的持续提升。
- 错误证据预测的比例从初始迭代(BERT-HA)的 80% 降低至三次自训练迭代后的 60%,其中 27% 的错误预测被高置信度纠正。
- 仅有 4% 的预测被错误地修改并传播,但近 50% 的此类错误在后续迭代中得到纠正,表明对错误传播具有强韧性。
- 该方法在涵盖三种 MRC 任务的七个数据集上均实现一致性能提升,证明其泛化能力与有效性。
- 尽管强基线模型(如 RoBERTa-HA)已实现高达 92.6% 的答案准确率,STM 仍显著提升了证据抽取性能,表明更优的证据抽取能进一步增强强模型的性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。