[论文解读] Parsing as Pretraining
本文提出了一种新颖的方法,仅使用预训练语言模型编码器执行完整的成分解析和依存解析,无需任何特定任务的解码器或解析算法。通过将解析重新表述为序列标注任务,并使用单个前馈层将词向量映射到线性化的树结构,该方法在PTB上实现了93.5%的括号F1分数,在en-ewt UD上实现了78.8%的LAS,达到当前最先进水平,表明即使未经微调,预训练模型也内在地编码了句法结构。
Recent analyses suggest that encoders pretrained for language modeling capture certain morpho-syntactic structure. However, probing frameworks for word vectors still do not report results on standard setups such as constituent and dependency parsing. This paper addresses this problem and does full parsing (on English) relying only on pretraining architectures -- and no decoding. We first cast constituent and dependency parsing as sequence tagging. We then use a single feed-forward layer to directly map word vectors to labels that encode a linearized tree. This is used to: (i) see how far we can reach on syntax modelling with just pretrained encoders, and (ii) shed some light about the syntax-sensitivity of different word vectors (by freezing the weights of the pretraining network during training). For evaluation, we use bracketing F1-score and LAS, and analyze in-depth differences across representations for span lengths and dependency displacements. The overall results surpass existing sequence tagging parsers on the PTB (93.5%) and end-to-end EN-EWT UD (78.8%).
研究动机与目标
- 探究仅使用预训练语言模型是否可以在不使用任何特定任务解码或结构特征的情况下执行完整解析。
- 通过在训练期间冻结预训练网络权重,评估不同词向量表示的句法敏感性。
- 通过直接解析性能评估各种预训练架构捕捉词形-句法结构的能力。
- 提供一个统一的框架,用于使用完整解析设置分析词向量的句法能力。
提出的方法
- 通过将树结构线性化为标签序列,将成分解析和依存解析均转化为序列标注任务。
- 使用单个前馈层将输入词嵌入映射到表示解析树的输出标签序列。
- 冻结预训练编码器权重以分析静态词向量的句法敏感性,并微调权重以评估端到端性能。
- 在标准基准上进行评估:使用括号F1和LAS分数,在PTB上评估成分解析,在en-ewt UD上评估依存解析。
- 通过分析跨度长度、跨度标签、依存位移和关系类型,探测量化语言能力。
- 在相同设置下比较预计算嵌入(如FastText)与上下文嵌入(如ELMo、BERT)的性能。
实验结果
研究问题
- RQ1预训练语言模型在不使用任何特定任务解码或结构特征的情况下,能在多大程度上实现完整解析?
- RQ2在冻结权重的情况下,哪些预训练架构在解析性能上编码了最多的句法结构?
- RQ3不同类型的词向量(静态 vs. 上下文相关)在跨度长度、标签频率和依存位移等句法现象上的表现如何?
- RQ4语言建模目标是否天然地比依存结构更有效地编码短语结构?
- RQ5仅使用预训练编码器,通过单个线性头进行序列标注,能否实现具有竞争力的解析性能?
主要发现
- 该模型在PTB测试集上达到93.5%的括号F1分数,在en-ewt UD测试集上达到78.8%的LAS,优于现有的序列标注解析器。
- 冻结的ELMo和BERT表示在跨度识别任务上优于静态的FastText嵌入,尤其在长跨度和低频跨度上表现更优。
- 上下文嵌入(ELMo、BERT)在复杂句法结构(如长跨度或稀有跨度)以及困难的依存关系(如根节点、nsubj、obj)上表现出显著更优的性能。
- 依存解析的性能低于成分解析,ELMo和BERT相较于静态向量的提升较小,表明其对依存结构的编码能力较弱。
- 结果表明,语言建模目标可能天然地更有效地编码短语结构概念,而非依存关系,这从成分解析和跨度级任务中表现更优可得证实。
- 分析显示,当进行微调时,BERT仅通过其预训练表示即可实现强大的解析性能,无需为解析任务额外设计架构。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。