[论文解读] Coreferential Reasoning Learning for Language Representation
本文提出 CorefBERT,一种通过引入一种新颖的预训练任务——提及指代预测(Mention Reference Prediction, MRP)来增强共指推理能力的语言表示模型。该任务通过遮蔽文本中重复出现的提及,并要求模型从上下文中预测其指代对象。CorefBERT 在依赖共指的任务上取得了显著提升,同时在通用 NLP 基准测试中保持了优异性能。
Language representation models such as BERT could effectively capture contextual semantic information from plain text, and have been proved to achieve promising results in lots of downstream NLP tasks with appropriate fine-tuning. However, most existing language representation models cannot explicitly handle coreference, which is essential to the coherent understanding of the whole discourse. To address this issue, we present CorefBERT, a novel language representation model that can capture the coreferential relations in context. The experimental results show that, compared with existing baseline models, CorefBERT can achieve significant improvements consistently on various downstream NLP tasks that require coreferential reasoning, while maintaining comparable performance to previous models on other common NLP tasks. The source code and experiment details of this paper can be obtained from https://github.com/thunlp/CorefBERT.
研究动机与目标
- 解决现有语言模型在句际边界之外处理长距离共指关系的局限性。
- 在不依赖大规模监督共指数据集的前提下,提升预训练模型的共指推理能力。
- 开发一种自监督的预训练目标,显式地从大规模无标注文本中捕捉共指关系。
- 在增强共指消解能力的同时,保持在通用 NLP 任务上的强性能。
- 探究基于复制的训练目标是否能提升共指任务中上下文敏感表征学习的能力。
提出的方法
- 提出一种新颖的预训练任务——提及指代预测(MRP),其中对篇章中重复出现的提及进行遮蔽,要求模型从上下文中预测其正确指代对象。
- 采用基于复制的训练目标,鼓励模型直接从上下文选择词语,而非从整个词汇表中选择,从而促进上下文敏感的表征学习。
- 将 MRP 与标准的掩码语言建模(MLM)相结合,联合优化局部上下文理解与长距离共指理解能力。
- 采用与 BERT 类似的多层双向 Transformer 架构,由于引入基于复制的目标,参数增加极少。
- 使用标准微调流程,在下游任务上通过任务特定的输出头层进行微调。
- 在微调过程中采用最大间隔损失(max-margin loss)进行共指消解,优化提及-指代对的正确对齐。
实验结果
研究问题
- RQ1一种显式建模共指关系的自监督预训练目标,是否能提升需要篇章级推理的下游 NLP 任务性能?
- RQ2引入基于复制的目标是否能增强模型学习共指消解所需上下文敏感表征的能力?
- RQ3能否在不依赖监督共指标注的情况下,从大规模无标注文本中有效学习共指推理能力?
- RQ4提升共指能力是否会导致在 GLUE 等通用 NLP 任务上的性能下降?
- RQ5与标准 MLM 相比,所提出的 MRP 预训练任务在提升长距离依赖建模方面表现如何?
主要发现
- CorefBERT 在依赖共指的任务上显著优于 BERT 和 RoBERTa,包括在 MRQA 上取得 43.40 的 F1 值,在 DocRED 上取得 180.65 的 F1 值,优于原始 BERT,甚至超越了 RoBERTa。
- 在 QUOREF 和 FEVER 基准测试中,CorefBERT ${}_{\textsc{large}}$ 分别取得 13.23 和 18.88 的 F1 值,表明在抽取式问答和事实验证任务中持续获得性能提升。
- CorefBERT 在 GLUE 基准测试中与 BERT 表现相当,通用 NLP 任务的 F1 值为 9.22,表明其在通用语言理解能力上未出现退化。
- 模型的推理时间与 BERT 和 RoBERTa 相当,CorefBERT ${}_{\textsc{large}}$ 在 RTX 2080ti GPU 上每个样本约耗时 18.88 ms,计算开销极低。
- 消融实验证明,使用共指消解工具对训练数据进行预处理可提升性能,优于未使用 NSP 的 BERT,但仍未达到完整 CorefBERT 的水平,表明弱监督设置下仍需更好的噪声处理机制。
- 微调的最佳超参数为基础初始学习率为 $3 \times 10^{-5}$,$\alpha = 10$,$\beta = 0.2$,验证了最大间隔损失的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。