[论文解读] StructFormer: Joint Unsupervised Induction of Dependency and Constituency Structure from Masked Language Modeling
StructFormer 提出了一种新颖的、端到端的无监督框架,通过在 Transformer 架构中结合基于距离的解析机制与依赖约束的自注意力机制,联合诱导依存结构与短语结构。该方法在无监督依存解析(46.2 UAS)和掩码语言建模任务中均取得了最先进性能,且在无需金标准词性标注或外部监督的情况下学习句法结构。
There are two major classes of natural language grammar -- the dependency grammar that models one-to-one correspondences between words and the constituency grammar that models the assembly of one or several corresponded words. While previous unsupervised parsing methods mostly focus on only inducing one class of grammars, we introduce a novel model, StructFormer, that can simultaneously induce dependency and constituency structure. To achieve this, we propose a new parsing framework that can jointly generate a constituency tree and dependency graph. Then we integrate the induced dependency relations into the transformer, in a differentiable manner, through a novel dependency-constrained self-attention mechanism. Experimental results show that our model can achieve strong results on unsupervised constituency parsing, unsupervised dependency parsing, and masked language modeling at the same time.
研究动机与目标
- 开发一种统一的、端到端的无监督框架,从原始文本中联合诱导依存与短语结构。
- 消除无监督解析中对金标准词性标注或外部语言学监督的依赖。
- 将句法结构诱导直接整合到 Transformer 的自注意力机制中。
- 评估诱导出的依存结构是否能提升掩码语言建模任务的性能。
- 证明单一模型可同时在无监督解析与预训练任务中实现优异性能。
提出的方法
- 该模型使用基于距离的解析机制,为每个词元预测句法距离(T)与句法高度(Δ),以联合表示依存与短语结构。
- 从 T 和 Δ 出发,以可微分方式计算父节点与依存节点的注意力分布,以定义有向依存关系。
- 提出一种新型的依赖约束自注意力机制,限制每个注意力头仅能关注其父节点或依存节点,取代标准的全连接注意力机制。
- 注意力机制结合父节点与依存节点关系的加权和,使模型在预训练过程中能够学习结构化的归纳偏置。
- 模型在掩码语言建模任务上进行端到端训练,句法结构通过梯度下降自然涌现。
- 通过在每个词元的预测依存分布上取 argmax,提取最终的依存图。
实验结果
研究问题
- RQ1单一无监督模型能否从原始文本中联合诱导出依存与短语结构?
- RQ2可微分的依赖约束注意力机制能否有效引导 Transformer 在无金标准标签的情况下学习有向句法图?
- RQ3诱导出的句法结构是否能提升掩码语言建模任务的性能?
- RQ4父节点与依存节点注意力关系的相对贡献如何影响解析与预训练性能?
- RQ5所提出的框架在性能上是否可与依赖于金标准词性标注或预训练嵌入的现有无监督解析方法相媲美?
主要发现
- StructFormer 在 WSJ 测试集上达到 46.2 UAS 的性能,且未使用金标准词性标注,在相同设置下优于大多数现有无监督模型。
- 模型恢复了 61.6% 的无向依存关系(UUAS),表明其在句法连接恢复方面表现强劲。
- 当仅使用父节点或依存节点关系时,性能显著下降,表明两种关系对实现平衡的解析性能均至关重要。
- 模型在浅层优先关注父节点关系,随网络加深逐渐引入依存节点关系,表明其具备分层注意力学习能力。
- 诱导出的依存结构提升了掩码语言建模性能,证明句法归纳偏置有助于提升预训练效果。
- 该框架成功在单一、端到端可微分架构中统一实现了依存与短语结构的联合诱导。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。