Skip to main content
QUICK REVIEW

[论文解读] Deeper Task-Specificity Improves Joint Entity and Relation Extraction

Phil Crone|arXiv (Cornell University)|Feb 15, 2020
Topic Modeling参考文献 24被引用 4
一句话总结

本文通过为命名实体识别(NER)和关系抽取(RE)分别引入额外的任务特定双向RNN(BiRNN),提出了一种更深层次的任务特定性方法,用于多任务学习中的联合NER与RE任务。该方法在ADE数据集上达到最先进性能,在CoNLL04数据集上取得具有竞争力的结果,且参数量仅为先前最先进模型的1/10,表明更深层次的任务特定性显著提升了性能,且共享层与任务特定层之间的平衡应根据数据集进行调优。

ABSTRACT

Multi-task learning (MTL) is an effective method for learning related tasks, but designing MTL models necessitates deciding which and how many parameters should be task-specific, as opposed to shared between tasks. We investigate this issue for the problem of jointly learning named entity recognition (NER) and relation extraction (RE) and propose a novel neural architecture that allows for deeper task-specificity than does prior work. In particular, we introduce additional task-specific bidirectional RNN layers for both the NER and RE tasks and tune the number of shared and task-specific layers separately for different datasets. We achieve state-of-the-art (SOTA) results for both tasks on the ADE dataset; on the CoNLL04 dataset, we achieve SOTA results on the NER task and competitive results on the RE task while using an order of magnitude fewer trainable parameters than the current SOTA architecture. An ablation study confirms the importance of the additional task-specific layers for achieving these results. Our work suggests that previous solutions to joint NER and RE undervalue task-specificity and demonstrates the importance of correctly balancing the number of shared and task-specific parameters for MTL approaches in general.

研究动机与目标

  • 解决现有用于联合NER与RE的多任务学习模型中任务特定参数利用不足的问题。
  • 探究在浅层架构之外增加任务特定性是否能提升联合NER与RE任务的性能。
  • 证明共享层与任务特定层之间的最优平衡因数据集而异,应针对不同领域进行调优。
  • 通过更深层次的任务特定设计,在降低模型复杂度的同时保持或提升性能。
  • 提供实证证据表明,任务特定层对复杂任务(如关系抽取)尤为重要。

提出的方法

  • 为NER和RE分别引入额外的任务特定双向RNN(BiRNN)层,实现超越先前工作的更深层次任务特定性。
  • 将共享层与任务特定层的BiRNN层数作为独立超参数,根据数据集独立调优。
  • 采用硬参数共享机制:先由共享层处理输入,随后分别通过NER和RE的任务特定BiRNN层。
  • 使用BIO/BILOU标注方案进行NER,并在联合解码框架中预测实体对之间的关系。
  • 在两个数据集(ADE和CoNLL04)上应用该模型,采用相同的训练与评估协议,并在各次实验中使用随机权重初始化。
  • 通过移除NER特定、RE特定或所有任务特定BiRNN层,同时保持总参数量不变,进行消融实验。

实验结果

研究问题

  • RQ1在多任务学习架构中增加任务特定性是否能提升联合NER与RE任务的性能?
  • RQ2在不同数据集上,共享层与任务特定层的不同配置如何影响联合NER与RE模型的性能?
  • RQ3更深层次的任务特定性是否能在保持或超越最先进性能的同时,显著减少可训练参数量?
  • RQ4任务特定层对NER或RE任务的增益是否更显著?原因是什么?
  • RQ5共享层与任务特定层的最优平衡是否可基于每个数据集的经验确定,而非采用固定架构?

主要发现

  • 所提模型在ADE数据集上实现了最先进性能,NER的F1得分为89.78(宏平均),RE的F1得分为72.63(宏平均)。
  • 在CoNLL04数据集上,模型在NER任务上达到最先进性能(89.78宏平均F1),在RE任务上达到接近最先进水平(71.08微平均F1),优于先前模型。
  • 该模型的可训练参数量约为当前最先进架构的1/10,同时保持或超越其性能表现。
  • 消融实验表明,移除RE特定BiRNN层后,RE的F1得分显著下降至55.47(微平均),表明RE对任务特定容量具有强依赖性。
  • NER性能对移除NER特定层的敏感性较低,表明RE任务更复杂,更受益于任务特定建模。
  • 即使不包含NER特定层,仅保留RE特定层和共享层的模型,仍优于Nguyen和Verspoor(2019)的模型,凸显了更深层次共享与任务特定架构的优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。