Skip to main content
QUICK REVIEW

[论文解读] Exposing ambiguities in a relation-extraction gold standard with crowdsourcing

Tong Shu Li, Benjamin M. Good|arXiv (Cornell University)|May 23, 2015
Biomedical Text Mining and Ontologies参考文献 12被引用 4
一句话总结

本文提出一种众包方法,用于生成生物医学文本中药物-疾病关系抽取的黄金标准,表明众包判断在60个测试句上与专家标注的符合率达到71.7%。研究发现,无论是专家还是众包标注者,标注者间的一致性水平均可作为数据或标注指南模糊性的可重复指标,进一步证实了众包的可行性,并强调在黄金标准中暴露一致性度量的重要性。

ABSTRACT

Semantic relation extraction is one of the frontiers of biomedical natural language processing research. Gold standards are key tools for advancing this research. It is challenging to generate these standards because of the high cost of expert time and the difficulty in establishing agreement between annotators. We implemented and evaluated a microtask crowdsourcing approach that can produce a gold standard for extracting drug-disease relations. The aggregated crowd judgment agreed with expert annotations from a pre-existing corpus on 43 of 60 sentences tested. The levels of crowd agreement varied in a similar manner to the levels of agreement among the original expert annotators. This work rein-forces the power of crowdsourcing in the process of assembling gold standards for relation extraction. Further, it high-lights the importance of exposing the levels of agreement between human annotators, expert or crowd, in gold standard corpora as these are reproducible signals indicating ambiguities in the data or in the annotation guidelines.

研究动机与目标

  • 评估利用众包创建生物医学关系抽取高质量黄金标准的可行性。
  • 评估众包判断在预存在的语料库中与专家标注的一致性程度。
  • 探究专家与众包标注者之间的一致性水平是否可作为数据或标注指南模糊性的信号。
  • 证明一致性评分是黄金标准语料库中模糊性的可重复指标。

提出的方法

  • 设计了一个微任务众包平台,用于在60个生物医学句子中收集药物-疾病关系的二元判断(存在/不存在)。
  • 众包工作者独立标注句子,每条句子由多名标注者处理,以确保可靠性。
  • 将聚合的众包判断与预存在的黄金标准语料库中的专家标注进行比较。
  • 使用Fleiss’ Kappa度量标注者间的一致性,量化专家与众包标注者之间的一致性水平。
  • 分析句子间的一致性模式,识别出共识度低的句子,表明可能存在模糊性。
  • 通过将众包表现与保留的60个句子测试集上的专家标注进行对比,验证了结果。

实验结果

研究问题

  • RQ1众包能否为生物医学文本中的药物-疾病关系抽取生成可靠的黄金标准?
  • RQ2众包标注者在相同句子集上的判断一致性水平与专家标注者相比如何?
  • RQ3标注者之间一致性得分较低在多大程度上反映了数据本身或标注指南中的真实模糊性?
  • RQ4标注者间的一致性能否作为黄金标准语料库中模糊性的可重复信号?
  • RQ5暴露一致性度量是否能提升黄金标准数据集的透明度和实用性?

主要发现

  • 聚合的众包判断在60个测试句上与专家标注达到71.7%的一致性,表明与专家标注水平高度一致。
  • 众包标注者之间的一致性水平与原始专家标注者之间观察到的一致性水平非常接近。
  • 标注者间一致性较低的句子——无论是在专家还是众包中——往往具有模糊的措辞或不清晰的语义关系。
  • 本研究证实,众包是生成生物医学NLP黄金标准的一种可行且成本效益高的方法。
  • 暴露一致性得分可提供一种透明且可重复的模糊性信号,有助于研究人员识别数据中存在潜在问题或模糊性的样本。
  • 结果强调了在黄金标准语料库中包含一致性度量的重要性,以指导模型的开发与评估。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。