[论文解读] Discourse Probing of Pretrained Language Models
本文引入文档级话语探针,以评估7种模型和4种语言下预训练语言模型捕捉跨文档话语结构的能力。BART的编码器整体表现最佳,而尽管其预训练目标更简单,BERT的表现却出人意料地出色,且不同层和模型间性能差异显著。
Existing work on probing of pretrained language models (LMs) has predominantly focused on sentence-level syntactic tasks. In this paper, we introduce document-level discourse probing to evaluate the ability of pretrained LMs to capture document-level relations. We experiment with 7 pretrained LMs, 4 languages, and 7 discourse probing tasks, and find BART to be overall the best model at capturing discourse -- but only in its encoder, with BERT performing surprisingly well as the baseline model. Across the different models, there are substantial differences in which layers best capture discourse information, and large disparities between models.
研究动机与目标
- 评估预训练语言模型在捕捉文档级话语结构方面的能力,超越句法层面的语法结构。
- 探究BERT的研究发现是否可推广至架构、预训练目标和语言不同的其他模型。
- 识别每个模型中最佳捕捉话语信息的层,并分析不同模型和语言间性能的差异。
- 基于话语结构理论(Rhetorical Structure Theory, RST)系统性地分析话语结构,共设计7项探针任务。
提出的方法
- 基于话语结构理论(Rhetorical Structure Theory, RST)设计7项话语探针任务,包括核性、话语关系、EDU分割和故事补全。
- 在4种语言(英语、中文、德语和西班牙语)中评估7种预训练模型(BERT、RoBERTa、ALBERT、ELECTRA、GPT-2、BART、T5)。
- 采用逐层探针方法评估每个Transformer层的表示质量,分类头应用于池化表示(如[CLS]或平均池化)。
- 在每个任务的标准数据集上进行训练和评估,包括RST-DT、CDTB、Potsdam Commentary和XSum(用于故事补全)。
- 报告所有任务和模型的性能结果,结果基于三次随机种子的平均值,标准差一并报告。
- 对比BERT中[CLS]标记与平均池化的表现,并评估冻结和微调后的BERT层,以评估表示的稳定性。
实验结果
研究问题
- RQ1不同预训练语言模型在多种语言下捕捉文档级话语结构的能力如何?
- RQ2每个模型中哪些层最能捕捉话语信息,且这种表现如何随模型变化?
- RQ3BERT在句法层面任务中的优异表现是否能推广到不同语言的文档级话语探针任务中?
- RQ4具有不同预训练目标(如MLM、DAE、LM)的模型在捕捉话语结构方面表现如何比较?
- RQ5英语中的研究结果在低资源语言(如中文、德语和西班牙语)中能多大程度上具有泛化性?
主要发现
- BART的编码器在所有话语探针任务中平均表现最高,显著优于其他模型,展现出更强的文档级话语结构捕捉能力。
- BERT在所有语言中表现出人意料的优异性能,尤其在核性和关系分类任务中表现突出,尽管其预训练目标更简单(MLM + NSP)。
- 性能在不同层间差异显著:对于BERT,最佳表现出现在中间到上层(如第10–12层);而BART编码器的峰值出现在第7–12层。
- GPT-2作为仅解码器模型,在大多数话语任务中表现较差,尤其在核性和关系分类任务中,表明其话语理解能力有限。
- T5表现稳定但中等,核性和关系任务得分较低,暗示其对层次化话语结构的捕捉能力有限。
- 在大多数任务中,平均池化表现弱于[CLS]标记表示,尤其是在深层网络中,尽管这种差距在更深的层中逐渐减小。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。