Skip to main content
QUICK REVIEW

[论文解读] GATE: Graph Attention Transformer Encoder for Cross-lingual Relation and Event Extraction

Wasi Uddin Ahmad, Nanyun Peng|arXiv (Cornell University)|Oct 6, 2020
Topic Modeling被引用 10
一句话总结

GATE 提出了一种图注意力变换器编码器,通过利用通用依存句法分析中的句法距离来增强跨语言关系与事件抽取中的自注意力机制。通过以结构化距离加权注意力,GATE 能够捕捉长距离依赖关系,并降低对词序的敏感性,在 ACE05 数据集上对英语、中文和阿拉伯语均实现了最先进性能,显著优于先前基于 GCN 的方法。

ABSTRACT

Recent progress in cross-lingual relation and event extraction use graph convolutional networks (GCNs) with universal dependency parses to learn language-agnostic sentence representations such that models trained on one language can be applied to other languages. However, GCNs struggle to model words with long-range dependencies or are not directly connected in the dependency tree. To address these challenges, we propose to utilize the self-attention mechanism where we explicitly fuse structural information to learn the dependencies between words with different syntactic distances. We introduce GATE, a {\bf G}raph {\bf A}ttention {\bf T}ransformer {\bf E}ncoder, and test its cross-lingual transferability on relation and event extraction tasks. We perform experiments on the ACE05 dataset that includes three typologically different languages: English, Chinese, and Arabic. The evaluation results show that GATE outperforms three recently proposed methods by a large margin. Our detailed analysis reveals that due to the reliance on syntactic dependencies, GATE produces robust representations that facilitate transfer across languages.

研究动机与目标

  • 解决图卷积网络(GCNs)在建模跨语言信息抽取中长距离依赖关系以及依存树中孤立词时的局限性。
  • 降低对英语、中文和阿拉伯语等类型学差异显著语言中词序差异的敏感性。
  • 通过在自注意力机制中显式引入句法距离,改善跨语言迁移能力,实现更优的结构化表征学习。
  • 开发一种在低资源、多语言设置下保持鲁棒性能的模型,且无需依赖平行数据或复杂的词序重排策略。

提出的方法

  • GATE 采用多头自注意力机制,其中注意力权重由来自通用依存句法分析的成对句法距离调制。
  • 模型将句法距离用作可学习或固定的偏置项以引导注意力,从而在不考虑序列距离的情况下有效建模长距离依赖关系。
  • 采用 M-BERT 的上下文词表示作为输入特征,增强跨语言迁移能力。
  • 该架构设计为对词序具有语言无关性,依赖依存结构而非线性序列进行关系推理。
  • GATE 允许基于句法结构在注意力头之间传递信息,从而实现提及类型与事件/关系标签之间的相关性学习。
  • 模型在句子级别的关系与事件抽取任务上进行端到端训练,注意力权重根据词语之间的句法路径长度动态调整。

实验结果

研究问题

  • RQ1基于句法距离加权的注意力机制是否能在跨语言关系与事件抽取中建模长距离依赖关系方面优于 GCN?
  • RQ2将句法距离引入自注意力机制是否能降低模型对英语、中文和阿拉伯语等语言中词序变化的敏感性?
  • RQ3语法感知注意力在低资源设置下的零样本或少样本跨语言迁移中能提升多少性能?
  • RQ4语言通用特征(如词性标注、依存标签和实体类型)在 GATE 跨语言性能中的贡献程度如何?

主要发现

  • GATE 在 ACE05 基准测试中实现了最先进性能,在英语、中文和阿拉伯语的关系与事件抽取任务中均优于三种近期方法。
  • 在中文目标语言上,GATE 使用英语作为源语言进行事件抽取,达到 63.0 的 F1 值,显著优于次佳方法 3.3 F1 点。
  • 在阿拉伯语上,GATE 在关系抽取中达到 60.2 F1,在事件抽取中达到 63.0 F1,尽管平均句长较长(210 个词符),仍展现出强大的跨语言迁移能力。
  • 消融实验表明,实体类型特征对性能贡献最大,而词性标注和依存标签影响有限,可能由于分词噪声所致。
  • 该模型对源语言的特性(如词序和句子结构)不敏感,证实其在跨语言设置下的鲁棒性。
  • GATE 在三种语言上的性能均保持稳定,表明通过语法感知注意力实现了有效的语言无关表征学习。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。