Skip to main content
QUICK REVIEW

[论文解读] Does BERT agree? Evaluating knowledge of structure dependence through agreement relations

Geoff Bacon, Terry Regier|arXiv (Cornell University)|Aug 26, 2019
Topic Modeling参考文献 30被引用 14
一句话总结

本文通过 cloze 风格的掩码语言建模任务,在 26 种语言和四种语法一致关系类型(主语-动词、名词-限定词、名词-形容词及谓词-形容词)上评估了 BERT 捕捉结构依赖性一致关系的能力。总体而言,BERT 表现优异,但随着依存距离和干扰项数量的增加,准确率逐渐下降,表明其在英语主语-动词一致之外的句法泛化能力虽强但有限。

ABSTRACT

Learning representations that accurately model semantics is an important goal of natural language processing research. Many semantic phenomena depend on syntactic structure. Recent work examines the extent to which state-of-the-art models for pre-training representations, such as BERT, capture such structure-dependent phenomena, but is largely restricted to one phenomenon in English: number agreement between subjects and verbs. We evaluate BERT's sensitivity to four types of structure-dependent agreement relations in a new semi-automatically curated dataset across 26 languages. We show that both the single-language and multilingual BERT models capture syntax-sensitive agreement patterns well in general, but we also highlight the specific linguistic contexts in which their performance degrades.

研究动机与目标

  • 评估 BERT 是否能超越英语主语-动词数一致关系,捕捉结构依赖性一致关系。
  • 将评估范围扩展至 26 种类型学上多样的语言中的四种一致关系类型。
  • 研究依存距离和干扰项数量如何影响 BERT 在一致关系任务中的表现。
  • 发布一个新构建的半自动跨语言一致关系数据集,以支持未来研究。

提出的方法

  • 构建了一个包含 26 种语言的新型跨语言一致关系数据集,涵盖四种类型:主语-动词、名词-限定词、名词-形容词及谓词-形容词一致。
  • 采用 cloze 风格的掩码语言建模设置,其中一致关系对中的一个词被掩码,BERT 预测缺失的词。
  • 通过控制干扰项和依存距离,使用准确率评估所有一致类型和语言的表现。
  • 对语言和一致类型的结果进行聚合,以评估整体鲁棒性及对结构复杂性的敏感性。
  • 在性能图的误差棒中应用自举法 95% 置信区间,以确保统计可靠性。
  • 未来工作计划包括双掩码(控制词和目标词),以减少线索冗余,并比较不同评估方案。

实验结果

研究问题

  • RQ1BERT 在多大程度上泛化了英语主语-动词数一致关系之外的句法敏感一致模式?
  • RQ2BERT 的表现如何随不同一致类型(如限定词、形容词、谓词)和词法句法特征(如数、性)而变化?
  • RQ3依存距离和干扰项数量如何影响 BERT 在一致预测中的准确率?
  • RQ4是否存在语言特定的 BERT 一致性能模式,特别是在形态丰富或类型学上迥异的语言中?

主要发现

  • BERT 在 26 种语言的结构依赖性一致关系上均取得高准确率(高于 80%),表明其对句法结构知识具有强大的泛化能力。
  • 随着控制词与目标词之间距离的增加,性能略有但持续下降,表明其对长距离依存关系敏感。
  • 干扰项(具有冲突特征的名词)越多,准确率下降越明显,尤其在干扰项超过几个后更为显著。
  • 多语言 BERT 在大多数语言上的表现与单语言 BERT 相当,但表现因语言类型学和形态复杂性而异。
  • 总体而言,模型对干扰项和长距离依赖具有鲁棒性,但退化模式表明其在处理高结构歧义时存在局限。
  • 研究表明,BERT 的成功并非源于简单启发式方法,因为即使存在多个冲突线索,其表现依然强劲。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。