Skip to main content
QUICK REVIEW

[论文解读] Is Supervised Syntactic Parsing Beneficial for Language Understanding? An Empirical Investigation

Goran Glavašš, Ivan Vulić|arXiv (Cornell University)|Aug 15, 2020
Natural Language Processing Techniques被引用 10
一句话总结

本文研究了通过中间解析训练(IPT)将有监督的句法解析注入 RoBERTa 和 XLM-R 变压器模型后,是否能提升下游语言理解(LU)任务的性能。尽管在句法解析任务上达到了最先进水平,IPT 在自然语言推理(NLI)、释义识别和因果常识推理任务上仅带来微乎其微且不一致的性能提升,表明在大规模语言模型预训练时代,显式的通用依赖(Universal Dependencies)句法结构对语言理解的益处有限。

ABSTRACT

Traditional NLP has long held (supervised) syntactic parsing necessary for successful higher-level semantic language understanding (LU). The recent advent of end-to-end neural models, self-supervised via language modeling (LM), and their success on a wide range of LU tasks, however, questions this belief. In this work, we empirically investigate the usefulness of supervised parsing for semantic LU in the context of LM-pretrained transformer networks. Relying on the established fine-tuning paradigm, we first couple a pretrained transformer with a biaffine parsing head, aiming to infuse explicit syntactic knowledge from Universal Dependencies treebanks into the transformer. We then fine-tune the model for LU tasks and measure the effect of the intermediate parsing training (IPT) on downstream LU task performance. Results from both monolingual English and zero-shot language transfer experiments (with intermediate target-language parsing) show that explicit formalized syntax, injected into transformers through IPT, has very limited and inconsistent effect on downstream LU performance. Our results, coupled with our analysis of transformers' representation spaces before and after intermediate parsing, make a significant step towards providing answers to an essential question: how (un)availing is supervised parsing for high-level semantic natural language understanding in the era of large neural models?

研究动机与目标

  • 评估通过中间解析训练(IPT)注入有监督句法解析是否能提升最先进变压器模型在下游语言理解(LU)任务中的性能。
  • 探究来自通用依赖(UD)语料库树库的显式句法知识是否能改善自然语言推理、释义识别和因果常识推理等 LU 任务。
  • 比较 IPT 与直接微调以及其他方法(如上下文学习或适配器微调)的影响,重点关注变压器层中表征的变化。
  • 分析有监督解析所获得的结构知识是否与神经模型实现高层次语义理解所需的句法泛化类型相匹配。
  • 探讨句法归纳偏置在低资源设置与高资源、预训练主导的设置中的作用,特别是在零样本多语言迁移场景中。

提出的方法

  • 在通用依赖(UD)语料库树库上,通过双仿射依赖解析头对 RoBERTa 和 XLM-R 进行微调,以执行中间解析训练(IPT)。
  • 使用标准交叉熵损失在标准金标 UD 标注上端到端训练模型进行依赖解析,实现最先进水平的解析性能。
  • 将同一类经过句法信息增强的变压器模型在三个下游 LU 任务上进行微调:自然语言推理(MNLI)、释义识别(SNLI)和因果常识推理(HellaSwag)。
  • 将 IPT 微调模型的下游性能与未使用 IPT 的直接微调基线模型进行比较,以隔离注入句法知识的影响。
  • 使用线性-CKA(中心化核对齐)分析 IPT 前后变压器层中表征的变化,测量注入的新句法信息的程度。
  • 开展单语(英语)和零样本多语言迁移实验,即在目标语言的 UD 树库上对模型进行 IPT 微调后,再在英语 LU 任务上进行评估。

实验结果

研究问题

  • RQ1在 RoBERTa 和 XLM-R 模型中,使用通用依赖(UD)句法进行中间解析训练(IPT)是否能提升下游语言理解(LU)任务的性能?
  • RQ2IPT 如何影响变压器层的表征空间?它是否注入了在语言建模预训练中未存在的有意义的句法知识?
  • RQ3有监督解析提供的句法信息是否与 LU 任务中实现高层次语义理解所需的结构泛化类型相匹配?
  • RQ4IPT 的有效性在不同模型(如 BERT 与 RoBERTa)之间以及在零样本多语言迁移设置中如何变化?
  • RQ5与直接微调或其他方法(如适配器或上下文学习)相比,IPT 在多大程度上提供了新的归纳偏置?

主要发现

  • 使用通用依赖(UD)句法进行中间解析训练(IPT)在下游语言理解任务(包括自然语言推理(MNLI)、释义识别(SNLI)和因果常识推理(HellaSwag))上仅带来微乎其微且不一致的性能提升。
  • 尽管实现了最先进水平的句法解析性能,IPT 对下游 LU 任务的提升微乎其微,表明在大规模预训练范式中,显式句法监督对高层次理解的帮助有限。
  • 线性-CKA 分析显示,IPT 注入的新句法信息多于直接微调(ILMT),尤其在 BERT 模型中更为明显,但这一差异并未转化为性能增益,表明注入的句法结构与任务相关的结构之间存在错配。
  • 在较低层中,IPT 与原始 BERT 的 l-CKA 分数非常高,表明来自 UD 树库的句法知识与通过语言建模预训练已学习到的结构知识存在冗余。
  • RoBERTa 在 IPT 后的参数变化显著少于 BERT,表明 RoBERTa 的表征本身已更丰富且更具鲁棒性,可能归因于更大规模和更长周期的预训练。
  • 在零样本多语言迁移中,IPT 向 mBERT 和 XLM-R 注入了更多针对低资源语言(如德语、土耳其语)的句法知识,但同样仅带来微乎其微的性能增益,进一步支持了在该设置下有监督解析对 LU 无益的结论。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。