Skip to main content
QUICK REVIEW

[论文解读] TweetNERD -- End to End Entity Linking Benchmark for Tweets

Shubhanshu Mishra, Aman Saini|arXiv (Cornell University)|Oct 14, 2022
Topic Modeling被引用 4
一句话总结

TweetNERD 是一个大规模、时间多样化的基准数据集,包含 340,000 多条标注的推文,用于命名实体识别与消歧(NERD),将提及链接到 Wikidata 实体。该数据集支持在三个任务上评估 NERD 系统:命名实体识别(NER)、使用真实跨度的实体链接(EL)以及端到端链接,通过两个专用划分(OOD 和 Academic)评估模型在域外和时间上的泛化能力,报告了最先进模型(包括 GENRE、REL 和 NLAI API)的基线性能。

ABSTRACT

Named Entity Recognition and Disambiguation (NERD) systems are foundational for information retrieval, question answering, event detection, and other natural language processing (NLP) applications. We introduce TweetNERD, a dataset of 340K+ Tweets across 2010-2021, for benchmarking NERD systems on Tweets. This is the largest and most temporally diverse open sourced dataset benchmark for NERD on Tweets and can be used to facilitate research in this area. We describe evaluation setup with TweetNERD for three NERD tasks: Named Entity Recognition (NER), Entity Linking with True Spans (EL), and End to End Entity Linking (End2End); and provide performance of existing publicly available methods on specific TweetNERD splits. TweetNERD is available at: https://doi.org/10.5281/zenodo.6617192 under Creative Commons Attribution 4.0 International (CC BY 4.0) license. Check out more details at https://github.com/twitter-research/TweetNERD.

研究动机与目标

  • 为解决 Twitter 上命名实体识别与消歧(NERD)缺乏大规模、时间多样且持久的数据集的问题。
  • 提供一个基准,支持在多个任务上评估 NERD 系统:命名实体识别(NER)、使用真实跨度的实体链接(EL)以及端到端实体链接(End2End)。
  • 通过两个独立划分(TweetNERD-OOD(域外)和 TweetNERD-Academic(时间多样,基于现有基准重新标注))实现对模型在不同领域和时间周期下泛化能力的评估。
  • 通过提供公开可获取、采用 CC BY 许可的、具有统一标注指南并借助学术划分实现长期持久性的数据集,支持鲁棒 NERD 模型的研究。

提出的方法

  • 使用内部训练的标注员,通过自定义标注界面和详细指南,手动识别命名实体提及,并将其链接到 Wikidata 中的实体。
  • 从广泛的时间窗口(2010–2021)中采样推文,以确保时间多样性并减少时间周期偏差。
  • 创建了两个评估划分:TweetNERD-OOD,聚焦于更难消歧的实体,时间范围较短;TweetNERD-Academic,由非删除、时间多样的推文组成,源自现有学术基准,按照新指南重新标注。
  • 数据集使用字节级 UTF-16-BE 编码表示提及偏移量,并为未链接提及包含 NIL 标签。
  • 使用标准 NERD 指标进行评估,包括端到端任务的 entity_match,以及用于跨度预测的偏移感知指标。
  • 在所有划分上使用单张 A100 GPU 评估基线模型,包括 StanzaNLP、spaCy、AllenNLP、BERTweet、GENRE、REL、Lookup、TagMe、DBPedia Spotlight 和 Google 的 NLAI API。

实验结果

研究问题

  • RQ1现有 NERD 系统在具有统一标注的大规模、时间多样的 Twitter 基准上的表现如何?
  • RQ2模型在域外(OOD)和时间上相距较远的测试集上的泛化能力如何?
  • RQ3基于启发式方法的基线(如精确匹配查找)与最先进的神经网络模型在 Twitter 特定 NERD 任务上的表现相比如何?
  • RQ4Twitter NERD 中的性能上限和错误模式是什么,特别是在跨度边界预测方面?
  • RQ5知识库选择(Wikidata)和标注格式(字节偏移)如何影响模型评估和系统设计?

主要发现

  • Google 的 NLAI API 在 TweetNERD-OOD 划分上的端到端实体链接任务中表现最佳,优于专用模型如 GENRE 和 REL。
  • 在 TweetNERD-Academic 划分上,REL 和 GENRE 表现强劲,接近 NLAI API,表明其在时间多样的数据上具有良好的泛化能力。
  • 基于 Wikipedia 共现的简单查找启发式基线在 EL 和端到端任务上表现优异,尤其在学术划分上,凸显了基于流行度的基线的价值。
  • TwitterNER 和 AllenNLP 在 OOD 和学术划分上的命名实体识别系统中表现最佳,错误主要源于错误的跨度边界预测。
  • 标注者间一致性为中等,表明该标注任务本身具有内在难度,为当前系统设定了性能上限。
  • TweetNERD 的基于偏移的格式对传统 NER 系统构成挑战,要求修改以返回原始文本偏移量,尽管 entity_match 指标为端到端评估提供了与分词无关的替代方案。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。