[论文解读] Extracting Multiple-Relations in One-Pass with Pre-Trained Transformers
本文提出了一种基于预训练变换器的一次性关系抽取框架,能够在单次编码过程中同时预测实体对之间的多个关系,在 ACE 2005 基准测试中实现了最先进性能。通过将结构化预测层和实体感知自注意力机制整合到 BERT 中,该方法在保持高准确率的同时提升了效率与可扩展性。
Most approaches to extraction multiple relations from a paragraph require multiple passes over the paragraph. In practice, multiple passes are computationally expensive and this makes difficult to scale to longer paragraphs and larger text corpora. In this work, we focus on the task of multiple relation extraction by encoding the paragraph only once (one-pass). We build our solution on the pre-trained self-attentive (Transformer) models, where we first add a structured prediction layer to handle extraction between multiple entity pairs, then enhance the paragraph embedding to capture multiple relational information associated with each entity with an entity-aware attention technique. We show that our approach is not only scalable but can also perform state-of-the-art on the standard benchmark ACE 2005.
研究动机与目标
- 解决现有多种关系抽取(MRE)方法效率低下的问题,这些方法需要对输入文本进行多次编码遍历。
- 通过单次前向传播实现对实体对之间多个关系的同时预测。
- 提升在处理大规模或复杂输入文本的现实应用场景中的可扩展性与效率。
- 在 ACE 2005 和 SemEval 2018 Task 7 等标准 MRE 基准测试中实现最先进性能。
- 证明预训练模型如 BERT 可通过极少的架构修改被有效适配用于端到端的 MRE。
提出的方法
- 该方法以 BERT 作为基础编码器,并引入结构化预测层,实现对所有实体对关系的一次前向传播预测。
- 引入实体感知自注意力机制,使注意力头对输入序列中所有实体的位置保持敏感。
- 通过在最后一层对实体的标记级 BERT 表示进行平均池化,获得实体表示。
- 关系预测通过应用于每对实体表示拼接结果的线性分类器完成:$ P(r_{ij}|\mathbf{x},e_i,e_j) = \textrm{softmax}(\mathbf{W}^L[\mathbf{o}_i:\mathbf{o}_j] + \mathbf{b}) $。
- 模型采用端到端训练,并支持单次与多次推理设置的对比。
- 该方法可兼容除 BERT 外的其他基于变换器的编码器,如 RoBERTa。
实验结果
研究问题
- RQ1是否可以在单次编码遍历中从单个输入段落中提取多个关系,而不会牺牲性能?
- RQ2与标准 BERT 自注意力相比,实体感知自注意力如何提升关系抽取的准确性?
- RQ3当使用 BERT 等强大预训练嵌入时,简单的线性分类器是否足以满足 MRE 任务?
- RQ4与基于多遍 SRE 的方法相比,一次性 MRE 在速度与准确性方面表现如何?
- RQ5该方法是否能在无需大量微调或数据增强的情况下泛化至其他基准(如 SemEval 2018 Task 7)?
主要发现
- 所提出的单次模型在 ACE 2005 基准测试中取得了 63.14 的新最先进 F1 分数,优于先前方法。
- 推理阶段每秒可处理 126 个关系,比次佳方法(每秒 23 个关系)快 5.5 倍。
- 与多遍 SRE 基线相比,训练时间减少了 3.5 倍。
- 在 SemEval 2018 Task 7 上,模型达到 81.4 的 Macro-F1 和 83.1 的 Micro-F1,与最佳共享任务系统持平,且仅使用单一模型。
- 线性分类器的表现优于 MLP 和 Biaffine 层,表明 BERT 的表示本身已具备高度表达能力。
- 在 SemEval 2010 Task 8 基准测试中,添加实体感知注意力使性能提升 8%,证明其在单关系设置下同样有效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。