[论文解读] Inducing Syntactic Trees from BERT Representations
本文提出了一种新颖的、无需训练的方法,通过测量当一个词从句子中被移除时其上下文嵌入的变化程度(即其“可简化性”得分),从 BERT 表征中诱导出依存句法树。该方法利用 BERT 的深层上下文表示来估计句法角色:可简化性更高的词(如形容词)往往在依存树中为叶节点或子节点,而可简化性较低的词(如主要动词)则更可能是主干或根节点。该方法使用简单的解析算法实现了 40.6% 的无标签依存边得分(UAS),显著优于强大的右链基线(29.5% UAS),证明了无需微调即可直接从预训练语言模型表征中诱导句法结构的可行性。
We use the English model of BERT and explore how a deletion of one word in a sentence changes representations of other words. Our hypothesis is that removing a reducible word (e.g. an adjective) does not affect the representation of other words so much as removing e.g. the main verb, which makes the sentence ungrammatical and of "high surprise" for the language model. We estimate reducibilities of individual words and also of longer continuous phrases (word n-grams), study their syntax-related properties, and then also use them to induce full dependency trees.
研究动机与目标
- 探究是否能够直接从 BERT 表征中估计句法可简化性(即在不破坏语法正确性的前提下省略一个词的能力)。
- 探究是否可利用从 BERT 中提取的可简化性得分,在无需对句法标注数据进行微调的情况下诱导出投射式依存树。
- 评估基于 BERT 的可简化性与实际句法结构之间的对应关系,特别是叶节点、主干节点和根节点的识别。
- 开发并比较利用可简化性得分构建依存树的解析算法,目标是获得高于无信息基线的准确率。
提出的方法
- 短语 $ p $ 在句子 $ s $ 中的可简化性得分 $ r_{p,s} $ 定义为原始句子 $ s $ 中词的 BERT 表征与移除 $ p $ 后的修改句 $ s_{-p} $ 中对应词的 BERT 表征之间的平均欧氏距离。
- 从 BERT 编码器最后一层提取每个词位置的表征,并在句子中剩余的所有词上使用 L2 范数计算距离。
- 算法 D 使用递归头括号编码方式,通过贪心地插入满足结构约束(非交叉括号、存在主干)的最可简化短语来构建投射式树。
- 算法 R 在右链基线基础上进行改进,强制要求每个节点必须连接到其后方最近且可简化性更高的节点,从而确保父节点的可简化性低于其子节点。
- 该方法完全避免在句法数据上进行微调;所有得分和解析决策均直接从预训练的 BERT 模型中得出。
- 标点符号可选择性地赋予较低的可简化性,以提升性能,因为其通常具有极低的可简化性且会干扰解析。
实验结果
研究问题
- RQ1BERT 表征能否检测句法可简化性,即可简化词(如形容词)是否更容易被省略而不破坏语法正确性?
- RQ2基于 BERT 的可简化性得分在多大程度上与实际的依存树结构相关,例如叶节点和父子关系?
- RQ3可简化性得分是否可用于在无需任何句法标注数据微调的情况下构建准确的依存树?
- RQ4所提出的解析算法(D 和 R)与强大的无信息基线(如右链)相比,在无标签依存边得分(UAS)方面表现如何?
- RQ5根据句法理论预测,句子的根是否始终是可简化性最低的词?
主要发现
- 该方法在依存树中区分叶节点与非叶节点的准确率达到 74.5%,显著高于假设所有词均为叶节点的基线准确率 66.4%。
- 在 34% 的句子中,句法根节点是可简化性最低的词;若排除标点符号,则该比例上升至 46%,远超 13% 的随机基线。
- 通过假设父节点的可简化性低于子节点,该方法正确预测了 70.6% 的依存边方向,优于右链基线的 65.8%。
- 当对标点符号赋予降低的可简化性时,算法 R 实现了 40.6% 的 UAS,比右链基线(29.5%)高出 11.1 个百分点。
- 当对标点符号的可简化性进行降低处理时,算法 D 实现了 33.1% 的 UAS,表明即使在结构约束极少的情况下,该方法仍能显著优于基线。
- 词语的平均可简化性与词性标签存在相关性:形容词和副词表现出较高的可简化性,而动词表现出较低的可简化性,与语言学直觉一致。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。