[论文解读] Drugs4Covid: Drug-driven Knowledge Exploitation based on Scientific Publications
本文提出Drugs4Covid,一种基于药物的知识抽取系统,利用词嵌入和语义网技术从CORD-19语料库中挖掘药物、疾病与科学文献之间的关系。通过处理超过60,000篇文献和200万段落,该系统构建了一个公开可访问的知识图谱及搜索工具,使临床医生和研究人员能够探索药物重定位候选药物(如氯喹或阿奇霉素联合用药),支持关键词、药物及SPARQL查询。
In the absence of sufficient medication for COVID patients due to the increased demand, disused drugs have been employed or the doses of those available were modified by hospital pharmacists. Some evidences for the use of alternative drugs can be found in the existing scientific literature that could assist in such decisions. However, exploiting large corpus of documents in an efficient manner is not easy, since drugs may not appear explicitly related in the texts and could be mentioned under different brand names. Drugs4Covid combines word embedding techniques and semantic web technologies to enable a drug-oriented exploration of large medical literature. Drugs and diseases are identified according to the ATC classification and MeSH categories respectively. More than 60K articles and 2M paragraphs have been processed from the CORD-19 corpus with information of COVID-19, SARS, and other related coronaviruses. An open catalogue of drugs has been created and results are publicly available through a drug browser, a keyword-guided text explorer, and a knowledge graph.
研究动机与目标
- 应对新冠疫情中因药物短缺和治疗选择有限而带来的快速识别可重定位药物的紧迫需求。
- 克服在科学文献中提取药物相关知识的挑战,例如药物以不同名称提及或缺乏明确关系。
- 开发一种可扩展、可重用的框架,利用自然语言处理和基于本体的方法,在生物医学文献中实现面向药物的知识发现。
- 提供可访问的工具——搜索引擎、RESTful API和SPARQL端点——供临床医生、药剂师和研究人员探索药物-疾病关联。
- 创建一个公开可用、可扩展的知识图谱和药物目录,以支持未来的疫情应对和生物医学研究。
提出的方法
- 使用命名实体识别技术处理来自CORD-19语料库的60,000多篇科学论文,识别药物(通过ATC分类)和疾病(通过MeSH类别)。
- 应用词嵌入技术,对200万段文本中的药物和疾病提及进行语义关系建模。
- 使用自定义本体(DRUGS4COVID19)构建知识图谱,以表示药物-疾病、药物-药物和药物-文本关系。
- 实现多层信息检索系统,支持三种访问模式:面向药物的搜索、基于关键词的搜索以及基于SPARQL的模式查询。
- 集成RESTful生物API和SPARQL端点,支持对知识图谱和注释的程序化访问。
- 利用领域专家反馈和公民科学计划(如药学和医学专业学生)来验证并提升注释质量。
实验结果
研究问题
- RQ1在与新冠相关的研究中,具有免疫抑制和抗疟活性的药物与大环内酯类抗生素联合使用的有哪些?
- RQ2在冠状病毒研究背景下,使用美时喹和阿奇霉素与哪些疾病相关?
- RQ3如何结合自然语言处理和语义网技术,从大规模生物医学语料库中提取并组织药物-疾病关系?
- RQ4词嵌入和基于本体的建模在多大程度上能提升科学文献中可重定位药物候选的发现效率?
- RQ5公开且可重用的知识图谱在新冠等公共卫生紧急事件中如何支持临床决策?
主要发现
- 系统成功处理了60,000多篇文献和200万段文本段落,实现了大规模药物-疾病关系的抽取。
- 构建了一个公开可访问的知识图谱,通过结构化的RDF三元组暴露了超过100万条药物-疾病和药物-药物关系。
- 药物浏览器和基于关键词的搜索引擎支持用户通过通用名称、商品名或ATC代码检索相关段落及关联的药物/疾病。
- SPARQL端点支持复杂查询,例如识别与P01BA02(抗疟药)联合使用的J01FA(大环内酯类)药物,并可基于MESH编码和表示法进行精确过滤。
- RESTful Bio-API支持对药物和疾病资源的程序化访问,可集成到外部临床或研究工具中。
- 该系统已被第三方采用以识别治疗靶点,表明其效用已超越初始应用场景。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。