[论文解读] CODA-19: Using a Non-Expert Crowd to Annotate Research Aspects on 10,000+ Abstracts in the COVID-19 Open Research Dataset
CODA-19 是一个众包数据集,包含 10,966篇关于 COVID-19 的研究摘要,由来自 Amazon Mechanical Turk 的 248 名非专家工作者对其中的背景、目的、方法、发现/贡献和其他部分进行标注。该方法达到了专家水平的一致性(Cohen’s kappa = 0.741),且与专家标签相比准确率达到 82.2%,证明非专家能够快速、大规模地生成高质量的标注。
This paper introduces CODA-19, a human-annotated dataset that codes the Background, Purpose, Method, Finding/Contribution, and Other sections of 10,966 English abstracts in the COVID-19 Open Research Dataset. CODA-19 was created by 248 crowd workers from Amazon Mechanical Turk within 10 days, and achieved labeling quality comparable to that of experts. Each abstract was annotated by nine different workers, and the final labels were acquired by majority vote. The inter-annotator agreement (Cohen's kappa) between the crowd and the biomedical expert (0.741) is comparable to inter-expert agreement (0.788). CODA-19's labels have an accuracy of 82.2% when compared to the biomedical expert's labels, while the accuracy between experts was 85.0%. Reliable human annotations help scientists access and integrate the rapidly accelerating coronavirus literature, and also serve as the battery of AI/NLP research, but obtaining expert annotations can be slow. We demonstrated that a non-expert crowd can be rapidly employed at scale to join the fight against COVID-19.
研究动机与目标
- 解决迅速增长的 COVID-19 文献中对快速、可扩展且准确的标注的迫切需求,以支持科学发现和人工智能研究。
- 克服专家标注的瓶颈,因为专家标注过程缓慢且资源消耗大,尤其是在公共卫生紧急情况下。
- 证明非专家众包工作者在标注研究摘要方面可达到与生物医学专家相当的标注质量。
- 创建一个大规模、可靠且可重复使用的大数据集,用于在大流行背景下训练和评估 NLP 模型。
- 通过标准化的人工标注研究论文各部分,加快从 COVID-19 开放研究数据集获取结构化信息。
提出的方法
- 从 Amazon Mechanical Turk 招募 248 名非专家众包工作者,对来自 COVID-19 开放研究数据集的 10,966篇英文摘要进行标注。
- 每篇摘要由九名不同的工作者进行标注,以确保结果的稳健性并减少个体偏见。
- 对所有九名标注者的标注结果应用多数投票法,以确定每篇摘要各部分的最终标签。
- 使用 Cohen’s kappa 评估众包工作者与一位生物医学专家之间的标注者间一致性,以确保结果的可靠性。
- 将最终标签与一位生物医学专家标注的黄金标准集进行对比,以计算准确率和一致性度量指标。
- 重点关注五个标注类别:背景、目的、方法、发现/贡献和其他。
实验结果
研究问题
- RQ1在大流行背景下,非专家众包工作者能否为科学研究摘要生成可靠且准确的标注?
- RQ2非专家众包工作者与生物医学专家之间的标注者间一致性,与专家之间的标注者间一致性相比如何?
- RQ3与专家标注的黄金标准相比,最终众包标注标签的准确率是多少?
- RQ4在时间敏感的研究环境中,可扩展的非专家标注流程能否实现与基于专家的标注相当的质量?
- RQ5众包标注在多大程度上能够支持下游的 NLP 和科学文献整合任务?
主要发现
- 非专家众包工作者与生物医学专家之间的标注者间一致性为 0.741(Cohen’s kappa),与专家之间的一致性(0.788)相当。
- 最终的众包标注标签与专家标注的黄金标准相比,准确率达到 82.2%。
- 专家标注的标签准确率略高,为 85.0%,表明尽管众包结果高度可靠,但专家仍略为准确。
- 整个 10,966篇摘要的数据集在 10 天内完成标注,证明了该流程具有高度可扩展性和时间效率。
- 对九名标注者的结果应用多数投票法,显著提高了标签的可靠性,并减少了个体不一致带来的噪声。
- 结果验证了非专家众包可以被有效利用,以大规模生成高质量、结构化的科学文献标注。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。