[论文解读] DiaKG: an Annotated Diabetes Dataset for Medical Knowledge Graph Construction
DiaKG 是一个高质量的中文糖尿病领域知识图谱构建数据集,包含 22,050 个实体和 6,890 个关系,由医学与人工智能专家共同标注。使用最先进命名实体识别(NER)和关系抽取(RE)模型进行评估,结果显示其具有显著挑战性,NER 和 RE 的宏平均 F1 分数分别为 83.3% 和 83.6%,凸显其在推动糖尿病相关临床人工智能应用方面的价值。
Knowledge Graph has been proven effective in modeling structured information and conceptual knowledge, especially in the medical domain. However, the lack of high-quality annotated corpora remains a crucial problem for advancing the research and applications on this task. In order to accelerate the research for domain-specific knowledge graphs in the medical domain, we introduce DiaKG, a high-quality Chinese dataset for Diabetes knowledge graph, which contains 22,050 entities and 6,890 relations in total. We implement recent typical methods for Named Entity Recognition and Relation Extraction as a benchmark to evaluate the proposed dataset thoroughly. Empirical results show that the DiaKG is challenging for most existing methods and further analysis is conducted to discuss future research direction for improvements. We hope the release of this dataset can assist the construction of diabetes knowledge graphs and facilitate AI-based applications.
研究动机与目标
- 为糖尿病领域医学知识图谱构建解决高质量、疾病特异性标注语料库匮乏的问题。
- 通过在标注过程中融合医学与人工智能专家的洞见,提升医学 NLP 数据集的可用性与模型性能。
- 提供一个基准数据集,以支持基于人工智能的临床决策支持系统、药物推荐和诊断工具的开发。
- 促进复杂、上下文依赖性医学文本中命名实体识别与关系抽取的研究,特别是针对嵌套实体与长跨度实体。
提出的方法
- 基于 41 份权威中文糖尿病指南与共识文件构建,确保内容质量与临床相关性。
- 定义了 18 种实体类型与 15 种关系类型,包括上下文敏感型与长跨度实体(如“病因”),并支持嵌套实体。
- 采用双重视角标注策略,由 6 名医学医生与 2 名人工智能专家共同参与,以提升数据质量与模型友好性,并通过迭代优化标注指南。
- 实施三阶段处理流程:标注、医学专家质量控制(QC)以及通过随机抽样(300 条记录)进行最终验证,最终实现 90.4% 的实体准确率与 96.5% 的关系准确率。
- 使用最先进模型对数据集进行评估:X Li 等人(2019)的命名实体识别模型与双向 GRU-注意力关系抽取模型。
- 开展消融实验与错误分析,识别出如长跨度实体与长距离关系等挑战,尤其在“病因”与“原因”类型上表现突出。
实验结果
研究问题
- RQ1DiaKG 在复杂、上下文敏感的医学文本中,对嵌套与长跨度实体的命名实体识别任务中,作为基准数据集的有效性如何?
- RQ2DiaKG 在关系抽取任务中,对现有最先进模型的挑战程度如何,特别是在关系跨越多个句子时?
- RQ3在标注过程中整合人工智能专家的洞见,是否能相比传统仅由医学专家标注的方式,提升医学 NLP 模型的性能与可用性?
- RQ4当前模型在 DiaKG 上的主要失效模式是什么,特别是针对性能较低的实体与关系类型?
- RQ5该数据集的结构与标注质量如何支持糖尿病诊疗中端到端临床人工智能应用的开发?
主要发现
- DiaKG 数据集包含 22,050 个实体与 6,890 个关系,经过严格质量控制后,实体准确率达 90.4%,关系准确率达 96.5%。
- 命名实体识别的整体宏平均 F1 得分为 83.3%,在高频类型如“药物”(F1: 89.2%)与“疾病”(F1: 84.8%)上表现良好,而“病因”与“症状”因长跨度与上下文依赖性导致得分较低(F1: 62.9% 与 53.5%)。
- 关系抽取的整体宏平均 F1 得分为 83.6%,在“疾病分类”(F1: 91.8%)与“药物不良反应”(F1: 89.2%)上表现强劲,但在“手术-疾病”(F1: 33.3%)与“病因-疾病”(F1: 57.1%)上表现较差,表明长距离关系具有高度挑战性。
- 错误分析显示,模型在上下文依赖的实体类型分类上存在困难——例如,“糖尿病”在不同上下文中可能被标记为“疾病”或“原因”,凸显医学 NLP 中的关键挑战。
- 该数据集对当前最先进模型具有实际挑战性,尤其在长跨度实体(如“病因”,平均长度 10.3 个词)与跨句关系(43.4% 的关系涉及不同句子中的实体)方面。
- 本研究证实 DiaKG 适用于推动糖尿病医疗人工智能的发展,具有在临床决策支持、药物推荐与自我诊断系统中应用的潜力,且已通过天池平台公开发布。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。