Skip to main content
QUICK REVIEW

[论文解读] ReFinED: An Efficient Zero-shot-capable Approach to End-to-End Entity Linking

Tom Ayoola, Shubhi Tyagi|arXiv (Cornell University)|Jul 8, 2022
Topic Modeling被引用 6
一句话总结

ReFinED 是一种快速、端到端的实体链接模型,通过使用实体描述和类型,在单次前向传播中联合执行提及检测、细粒度实体类型识别和实体消歧。它在保持超过60倍于高精度基线模型速度的同时,实现了SOTA性能,平均F1提升达3.7个百分点,支持Wikidata的9000多万个实体,适用于大规模网络数据集的高效部署。

ABSTRACT

We introduce ReFinED, an efficient end-to-end entity linking model which uses fine-grained entity types and entity descriptions to perform linking. The model performs mention detection, fine-grained entity typing, and entity disambiguation for all mentions within a document in a single forward pass, making it more than 60 times faster than competitive existing approaches. ReFinED also surpasses state-of-the-art performance on standard entity linking datasets by an average of 3.7 F1. The model is capable of generalising to large-scale knowledge bases such as Wikidata (which has 15 times more entities than Wikipedia) and of zero-shot entity linking. The combination of speed, accuracy and scale makes ReFinED an effective and cost-efficient system for extracting entities from web-scale datasets, for which the model has been successfully deployed. Our code and pre-trained models are available at https://github.com/alexa/ReFinED

研究动机与目标

  • 开发一种高效、端到端的实体链接系统,能够对大型知识库(如Wikidata)中的未见实体实现零样本泛化。
  • 克服现有零样本EL模型计算效率低下的问题,这些模型需要多次前向传播或自回归解码。
  • 在保持低推理延迟的同时,超越现有SOTA方法在标准实体链接基准上的性能表现。
  • 通过结合速度、精度和对大型知识库的支持,实现在百亿网页规模数据集上的可扩展部署。
  • 通过将提及检测、类型识别和消歧统一为一个独立、自包含的模型,简化生产环境中的部署流程。

提出的方法

  • ReFinED 使用单一的基于Transformer的编码器,在一次前向传播中联合编码文档内所有提及和候选知识库实体。
  • 通过引入细粒度实体类型和完整实体描述作为输入特征,提升消歧效果,且无需为新实体微调。
  • 采用多任务学习目标,联合训练提及检测、细粒度实体类型识别和实体消歧。
  • 通过在Wikipedia超链接上进行预训练,提升对训练中未见实体的零样本泛化能力。
  • 通过同时编码所有提及和候选实体,避免多次推理过程,降低计算开销。
  • 在从Wikidata三元组中提取的弱监督数据集上进行微调,以提取实体类型,实现对大型知识库的可扩展性。

实验结果

研究问题

  • RQ1一个高效、基于Transformer的单一模型能否在高精度和低延迟下,联合完成提及检测、实体类型识别和实体消歧?
  • RQ2引入细粒度实体类型和完整描述是否能实现对大型知识库(如Wikidata)中未见实体的强大零样本泛化能力?
  • RQ3此类模型能否在显著快于现有支持零样本能力的基线模型的同时,达到SOTA性能?
  • RQ4该模型在知识库规模为Wikipedia的15倍(如Wikidata)时,是否能保持性能不下降?
  • RQ5该模型能否在百亿网页规模数据集上实现高效部署,且运维开销极低?

主要发现

  • 在8个标准实体链接数据集上,ReFinED 相较于先前方法平均F1提升3.7个百分点,创下新的SOTA记录。
  • 在WikiLinkNED未见提及基准上,ReFinED 达到68.2的F1分数,领先第二名模型4.9分。
  • ReFinED 的推理速度是BLINK交叉编码器的60倍,也是Cao等人(2020)自回归模型的140倍,仅用15秒即可完成AIDA-CoNLL数据集的推理。
  • 模型在500块T4 GPU上运行27,000个机器小时(约2天),处理了10亿网页中的250亿个提及,展现出高成本效益的可扩展性。
  • ReFinED 在Wikidata上保持了强劲性能,该知识库的实体数量是Wikipedia的15倍,证明其超越以Wikipedia为中心的知识库的可扩展性。
  • 由于采用单次前向传播的推理设计,ReFinED 的运维成本相比BLINK双编码器降低6倍以上,相比自回归模型降低140倍以上。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。