Skip to main content
QUICK REVIEW

[论文解读] Improving BERT with Syntax-aware Local Attention

Zhongli Li, Qingyu Zhou|arXiv (Cornell University)|Dec 30, 2020
Topic Modeling参考文献 19被引用 7
一句话总结

本文提出语法感知局部注意力(Syntax-aware Local Attention, SLA),通过依存分析计算基于距离的注意力掩码,将自注意力机制限制在句法相关的词语上,从而增强BERT模型。通过可学习门控机制将SLA与BERT集成,该模型在多个单句NLP任务中实现一致的性能提升,平均性能优于BERT及先前的基于句法的方法,在FCE数据集上达到最先进结果,并实现0.7的绝对F1提升。

ABSTRACT

Pre-trained Transformer-based neural language models, such as BERT, have achieved remarkable results on varieties of NLP tasks. Recent works have shown that attention-based models can benefit from more focused attention over local regions. Most of them restrict the attention scope within a linear span, or confine to certain tasks such as machine translation and question answering. In this paper, we propose a syntax-aware local attention, where the attention scopes are restrained based on the distances in the syntactic structure. The proposed syntax-aware local attention can be integrated with pretrained language models, such as BERT, to render the model to focus on syntactically relevant words. We conduct experiments on various single-sentence benchmarks, including sentence classification and sequence labeling tasks. Experimental results show consistent gains over BERT on all benchmark datasets. The extensive studies verify that our model achieves better performance owing to more focused attention over syntactically relevant words.

研究动机与目标

  • 通过将句法结构融入注意力机制,提升BERT在单句NLP任务中的性能。
  • 通过将注意力限制在局部相关且句法上有意义的词对上,解决BERT中全局注意力的局限性。
  • 开发一种轻量级、可集成的模块,可仅以极小的参数增加方式添加到预训练BERT中。
  • 验证句法结构作为局部归纳偏置,相较于固定或动态窗口机制,在注意力机制中更具有效性。
  • 证明语法感知局部注意力在多样化基准(包括句子分类和序列标注)中的普适性与有效性。

提出的方法

  • 从依存分析中推导句法距离,计算每个目标词到其邻近词(i±1)的最小距离,以定义局部注意力范围。
  • 基于这些距离构建语法感知注意力掩码,并将其应用于点积注意力机制,以限制注意力仅作用于句法上接近的词语。
  • 为每个词和每层引入可学习门控单元,动态平衡标准全局自注意力与语法感知局部注意力的贡献。
  • 将语法感知局部注意力集成到BERT的每个Transformer层中,使用预训练BERT的权重进行初始化,并进行端到端微调。
  • 注意力分数被计算为全局注意力与局部注意力的加权和,门控机制控制各分量的相对重要性。
  • 该方法在单句任务上进行评估,对每个输入句子应用依存分析以生成特定于任务的注意力掩码。

实验结果

研究问题

  • RQ1将句法结构融入局部注意力是否能提升BERT在单句NLP任务中的性能?
  • RQ2语法感知局部注意力是否在捕捉有意义的局部依赖方面优于基于窗口的局部注意力?
  • RQ3句法知识的集成如何影响注意力模式与模型可解释性?
  • RQ4所提出的方法是否可在无需架构修改的情况下有效应用于多样化基准?
  • RQ5门控机制在不同层中平衡全局与局部注意力的贡献如何?

主要发现

  • 语法感知局部注意力(SLA)在所有评估的单句基准上均实现对BERT的一致性能提升,包括句子分类和序列标注任务。
  • 在FEVER和FCE数据集上,SLA相较BERT实现0.7的绝对F1提升,在FCE上达到新的最先进水平。
  • SLA在平均性能上优于先前的基于句法的方法,证明了句法归纳偏置在局部注意力中的有效性。
  • 门控机制在深层网络中显示出更高的值,表明局部注意力在深层表示中发挥更重要的作用。
  • 注意力可视化结果表明,SLA能捕捉到关键的句法依赖关系(如'fresh air'关注'film'),而基于窗口的方法则会忽略这些关系。
  • 在句子对任务(如QNLI和RTE)中,SLA表现较差,原因在于跨句交互占主导地位,表明语法局部注意力在长距离、跨句推理中效果较弱。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。