[论文解读] A Distant Supervision Corpus for Extracting Biomedical Relationships Between Chemicals, Diseases and Genes
本文介绍了 ChemDisGene,一个大规模、远程监督的生物医学关系抽取语料库,包含 80,000 篇带有化学物质、疾病和基因之间关系标注的摘要。该语料库结合了基于 CTD 的训练集与人工精心整理的测试集,提升了实体链接和数据划分质量,更好地模拟现实世界场景,并提供了三种深度学习基线模型用于评估,显著提升了先前数据集在覆盖范围和质量方面的表现。
We introduce ChemDisGene, a new dataset for training and evaluating multi-class multi-label document-level biomedical relation extraction models. Our dataset contains 80k biomedical research abstracts labeled with mentions of chemicals, diseases, and genes, portions of which human experts labeled with 18 types of biomedical relationships between these entities (intended for evaluation), and the remainder of which (intended for training) has been distantly labeled via the CTD database with approximately 78\% accuracy. In comparison to similar preexisting datasets, ours is both substantially larger and cleaner; it also includes annotations linking mentions to their entities. We also provide three baseline deep neural network relation extraction models trained and evaluated on our new dataset.
研究动机与目标
- 解决化学物质、疾病和基因领域大规模、高质量生物医学关系抽取数据集稀缺且覆盖范围低的问题。
- 通过基于出版日期的时间划分(而非随机划分)来提升模型泛化能力,以更真实地模拟现实世界部署场景。
- 利用最先进的 PubTator Central 模型提升化学物质、疾病和基因的实体链接准确性。
- 提供一个基准测试集,包含自动标注(用于训练)和人工标注(用于评估)的数据,以支持稳健的模型评估。
- 在新语料库上训练并评估三种深度学习基线模型,为未来研究建立性能基准。
提出的方法
- 利用比较毒理基因组数据库(Comparative Toxicogenomics Database, CTD)自动远程标注 80,000 篇摘要,涵盖化学物质、疾病和基因之间的 14 种关系类型。
- 采用更新后的 PubTator Central 模型提升实体识别与链接性能,化学物质、疾病和基因的 F1 值分别提升 66.3%、3.8% 和 8.2%。
- 基于出版日期对训练数据进行划分,以模拟现实世界部署场景,相比随机划分,显著提升了模型泛化能力。
- 清洗并从 CTD 复杂嵌套的关系表示中提取二元关系,以提升训练数据质量。
- 创建了一个较小的、人工标注的测试集,包含 523 篇摘要和 18 种关系类型,由领域专家标注,用于评估。
- 在 ChemDisGene 语料库上训练并评估三种深度神经网络模型(如基于图的模型、自注意力机制模型),以建立基线性能。
实验结果
研究问题
- RQ1大规模、远程监督的生物医学关系抽取语料库能否提升深度学习模型在多类、多标签文档级关系抽取任务中的性能与泛化能力?
- RQ2基于出版日期的数据划分方式与随机划分相比,在模型评估保真度和现实世界适用性方面有何差异?
- RQ3改进的实体链接模型在多大程度上提升了远程监督训练数据的质量与实用性?
- RQ4当在大规模弱监督语料库上训练、并在较小的黄金标准测试集上评估时,最先进深度学习模型的性能如何?
- RQ5如何利用更大、更清洁的新数据集,为化学物质、疾病和基因之间的关系抽取建立性能基准?
主要发现
- ChemDisGene 语料库包含约 80,000 篇摘要,关系通过 CTD 实现远程标注,估计准确率达 78%。
- 人工精心整理的 523 篇摘要测试集为评估模型泛化能力和性能提供了高质量基准。
- 使用更新后的 PubTator Central 模型进行实体链接,相比以往模型,化学物质、疾病和基因的 F1 值分别提升 66.3%、3.8% 和 8.2%。
- 采用基于出版日期的时间划分(而非随机划分)更真实地模拟现实世界部署场景,提升了模型评估的可靠性。
- 在 ChemDisGene 上训练的三种基线深度学习模型在测试集上表现出色,为未来研究建立了新基准。
- 该数据集在规模、清洁度和标注质量方面显著优于现有语料库,尤其在实体链接和关系表示方面表现突出。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。