Skip to main content
QUICK REVIEW

[论文解读] What did you Mention? A Large Scale Mention Detection Benchmark for Spoken and Written Text

Yosi Mass, Lili Kotlerman|arXiv (Cornell University)|Jan 23, 2018
Topic Modeling参考文献 8被引用 5
一句话总结

本论文提出了一项大规模、高质量的基准测试,用于书面和口语文本中的提及检测,涵盖维基百科和噪声语音数据中的命名实体与一般实体。该基准通过受控的众包流程构建,遵循严格指南,每个数据集包含约6,500个提及。最先进的系统TagMe在干净文本上的F1得分为0.552,在ASR生成的语音上的F1得分为0.478,凸显了在噪声领域中一般实体检测的挑战。

ABSTRACT

We describe a large, high-quality benchmark for the evaluation of Mention Detection tools. The benchmark contains annotations of both named entities as well as other types of entities, annotated on different types of text, ranging from clean text taken from Wikipedia, to noisy spoken data. The benchmark was built through a highly controlled crowd sourcing process to ensure its quality. We describe the benchmark, the process and the guidelines that were used to build it. We then demonstrate the results of a state-of-the-art system running on that benchmark.

研究动机与目标

  • 为提及检测缺乏涵盖多种文本类型中命名实体与一般实体的综合性基准测试提供解决方案。
  • 开发一个高质量、可扩展的基准测试,用于评估在干净书面文本和噪声口语数据上的提及检测工具。
  • 为处理一般实体检测中的嵌套提及与实体具体性问题,建立清晰、一致的标注指南。
  • 支持对需覆盖整个文档中所有提及(而不仅首次出现)的系统进行评估。
  • 通过提供强大且多样的训练与评估数据,支持需要深层语义理解的NLP应用开发。

提出的方法

  • 该基准采用两阶段众包流程构建:第一阶段,每句话由10名标注员进行开放式提及检测;第二阶段,标注员基于共享候选列表确认或拒绝检测到的提及。
  • 共标注了1,000个维基百科句子(Wiki)、1,000个人工转录的口语句子(Trans)和1,000个自动语音识别(ASR)输出的句子(ASR),每个构成独立的数据集。
  • 制定了明确的标注指南,以标准化处理嵌套提及、实体具体性及一般实体类型,确保标注者之间的一致性。
  • 使用加权 Cohen's kappa 评估标注者间一致性,检测任务的kappa值分别为Wiki 0.30 和 Trans 0.34,确认任务的kappa值分别为Wiki 0.47 和 Trans 0.54,验证了基准的质量与覆盖范围。
  • 该基准已公开提供下载,以支持提及检测系统评估的可重现性。
  • 在配置为避免嵌套提及并优先选择更长短语后,对最先进的系统TagMe进行了评估,使其与基准指南保持一致。

实验结果

研究问题

  • RQ1如何构建一个大规模、高质量的提及检测基准测试,以涵盖书面和口语文本中的命名实体与一般实体?
  • RQ2在标注一般实体时,特别是在嵌套与具体性方面面临的关键挑战是什么?如何实现一致的解决?
  • RQ3最先进的提及检测系统在干净文本(维基百科)与噪声口语数据(ASR与转录口语)上的表现有何差异?
  • RQ4在整个文档范围内实现完整提及覆盖,在文本相似性等NLP任务中,能在多大程度上提升语义理解能力?
  • RQ5在强调一般实体检测与覆盖的基准测试中,简单的基于规则或检索的系统是否可能优于复杂的神经网络模型?

主要发现

  • 该基准包含1,000个维基百科句子和每种转录与ASR语音数据各1,000个句子,每个数据集约有6,500个提及,其中ASR与转录数据集中仅84个为命名实体。
  • 每句话的平均提及数为6.2,表明文本中实体覆盖度高,包括同一提及的多次出现。
  • 检测任务的标注者间一致性为中等(Wiki为kappa=0.30,Trans为kappa=0.34),反映出该任务的开放性;而确认任务的一致性更高(Wiki为kappa=0.47,Trans为kappa=0.54),表明高质量黄金标准的构建质量可靠。
  • TagMe在维基百科测试集上的F1得分为0.552,在人工转录口语集上为0.494,在ASR生成口语集上为0.478,表明随着噪声水平上升,性能呈下降趋势。
  • 该基准表明,一般实体占提及总数的绝大多数(超过90%),凸显了在评估与系统设计中纳入一般实体的重要性。
  • 结果表明,当前最先进的系统在噪声口语数据中对一般实体检测的性能更弱,揭示了当前NLP评估与开发中的关键差距。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。