Skip to main content
QUICK REVIEW

[论文解读] Crowdsourcing Information Extraction for Biomedical Systematic Reviews

Yalin Sun, Pengxiang Cheng|arXiv (Cornell University)|Sep 5, 2016
Mobile Crowdsensing and Crowdsourcing参考文献 4被引用 12
一句话总结

本研究探讨了利用众包从临床试验摘要中提取结构化生物医学干预数据以用于系统评价的可行性。通过在CrowdFlower平台上设计具有明确说明、验证检查和质量控制的任务,作者表明非专家工作者可在远低于专家提取成本的条件下实现合理的准确性(例如,关键字段准确率超过70%),表明众包可作为循证医学数据收集的一种可扩展替代方案。

ABSTRACT

Information extraction is a critical step in the practice of conducting biomedical systematic literature reviews. Extracted structured data can be aggregated via methods such as statistical meta-analysis. Typically highly trained domain experts extract data for systematic reviews. The high expense of conducting biomedical systematic reviews has motivated researchers to explore lower cost methods that achieve similar rigor without compromising quality. Crowdsourcing represents one such promising approach. In this work-in-progress study, we designed a crowdsourcing task for biomedical information extraction. We briefly report the iterative design process and the results of two pilot testings. We found that giving more concrete examples in the task instruction can help workers better understand the task, especially for concepts that are abstract and confusing. We found a few workers completed most of the work, and our payment level appeared more attractive to workers from low-income countries. In the future, we will further evaluate our results with reference to gold standard extractions, thus assessing the feasibility of tasking crowd workers with extracting biomedical intervention information for systematic reviews.

研究动机与目标

  • 探讨众包是否可作为生物医学系统评价中基于专家的数据提取的经济高效替代方案。
  • 设计并迭代优化一个众包任务,用于从临床试验摘要中提取结构化干预数据(例如,剂量、持续时间、给药途径)。
  • 评估任务设计要素(如详细说明、必填字段和质量控制机制)对工作者表现和数据质量的影响。
  • 评估该方法在大规模系统评价数据提取中的可扩展性。
  • 将众包结果与金标准标注进行比较,评估关键数据字段的准确性。

提出的方法

  • 任务在CrowdFlower平台上部署,工作者从96篇随机对照试验(RCT)摘要中将干预细节(剂量、持续时间、给药途径、给药方案)填入结构化文本框。
  • 每篇摘要分配了三次判断,通过多数投票机制聚合结果以提高可靠性。
  • 使用包含23个“简单”摘要的预筛选测验筛选低质量工作者,并插入额外的“蜜罐”示例以监控一致性。
  • 根据试点反馈迭代改进任务设计,包括增加必填字段验证器和提供更多标注示例的更清晰说明。
  • 在第二次试点中,将工作者限制为英语国家,以提高说明理解度和数据质量。
  • 通过测试问题和工作者满意度指标评估数据质量,重点关注一致性和准确性。

实验结果

研究问题

  • RQ1非专家众包工作者能否准确地从临床试验摘要中提取结构化的生物医学干预数据?
  • RQ2任务设计要素(如说明、必填字段和质量控制机制)如何影响数据质量和工作者表现?
  • RQ3将工作者限制为英语国家对数据准确性和一致性有何影响?
  • RQ4与金标准标注相比,众包数据在关键字段(如治疗名称、剂量和样本量)上的准确性如何?
  • RQ5众包能否在显著低于专家数据提取成本的情况下实现足够的准确性,以用于系统评价?

主要发现

  • 第二次试点测试中,测试问题的准确率达到94.3%,表明在设计优化后,工作者的理解力和表现有所提升。
  • 第二次试点中,工作者满意度得分显著提高,尤其体现在说明清晰度、工作难度和测试问题公平性方面。
  • 在设计改进后,提取答案的格式明显更整洁、更一致,特别是通过必填字段和更清晰示例的优化。
  • 大量工作由少数工作者完成,表明众包任务中可能存在工作量分配不均的问题。
  • 部分工作者认为报酬不公平,表明当前的薪酬水平可能需要调整,以提升工作者的保留率和积极性。
  • 与金标准标注的初步比较表明,关键字段(如样本量、治疗组大小和干预名称)的准确率超过0.70。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。