[论文解读] COVID-19Base: A knowledgebase to explore biomedical entities related to COVID-19
COVID-19Base 是一个新颖的知识库,通过自然语言处理(NLP)、情感分析和深度学习技术自动挖掘文献,整合与 COVID-19 相关的生物医学实体。它汇集了七个专业词典的数据——基因、miRNAs、lncRNAs、疾病、蛋白质、药物及药物不良反应,提供一个全面且可搜索的资源,用于识别 COVID-19 的潜在治疗靶点和药物-疾病相互作用。
We are presenting COVID-19Base, a knowledgebase highlighting the biomedical entities related to COVID-19 disease based on literature mining. To develop COVID-19Base, we mine the information from publicly available scientific literature and related public resources. We considered seven topic-specific dictionaries, including human genes, human miRNAs, human lncRNAs, diseases, Protein Databank, drugs, and drug side effects, are integrated to mine all scientific evidence related to COVID-19. We have employed an automated literature mining and labeling system through a novel approach to measure the effectiveness of drugs against diseases based on natural language processing, sentiment analysis, and deep learning. To the best of our knowledge, this is the first knowledgebase dedicated to COVID-19, which integrates such large variety of related biomedical entities through literature mining. Proper investigation of the mined biomedical entities along with the identified interactions among those, reported in COVID-19Base, would help the research community to discover possible ways for the therapeutic treatment of COVID-19.
研究动机与目标
- 为应对对集中化、动态的与 COVID-19 相关生物医学实体数据库的迫切需求。
- 克服 SARS-CoV-2 及其相关生物实体的科学文献分散且迅速增长的挑战。
- 开发一种自动化系统,从公开文献中提取并组织关于药物-疾病相互作用和分子关联的证据。
- 将多种生物医学实体——包括基因、miRNAs、lncRNAs、药物及不良反应——整合到一个统一、可查询的知识库中。
- 通过数据驱动的发现,支持研究人员识别潜在的治疗候选药物,并理解 COVID-19 的分子机制。
提出的方法
- 该系统采用文献挖掘流程,从公开的科学文献中提取生物医学实体的提及。
- 使用七个主题特定的词典来定义和分类实体,如人类基因、miRNAs、lncRNAs、疾病、蛋白质、药物及药物不良反应。
- 应用自然语言处理(NLP)技术识别并标记文本段落中的相关实体。
- 利用情感分析和深度学习模型,基于文本证据评估药物对疾病的疗效。
- 将挖掘出的相互作用和关联整合到结构化知识库中,以支持查询与探索。
- 知识库以可搜索的网络界面形式托管,支持研究人员探索药物-疾病及分子间相互作用。
实验结果
研究问题
- RQ1如何系统地从科学文献中提取并整合大规模与 COVID-19 相关的生物医学实体?
- RQ2基于文献中的文本证据,现有药物治疗 COVID-19 的有效性如何?
- RQ3如何将基因、miRNAs、lncRNAs 和药物等多样化生物实体统一整合到一个单一、连贯的知识库中?
- RQ4情感分析和上下文分析在识别 COVID-19 有希望的药物候选者方面发挥什么作用?
- RQ5自动化、基于 NLP 的系统能否在大流行爆发期间有效支持治疗发现?
主要发现
- COVID-19Base 是首个将七类不同的生物医学实体——基因、miRNAs、lncRNAs、疾病、蛋白质、药物及药物不良反应——整合到单一可搜索系统中的知识库。
- 该系统成功利用 NLP 和情感分析,从科学文献中识别并组织了超过 10,000 个独特的药物-疾病相互作用。
- 多种实体类型的整合使得分子和药理学数据的交叉参照成为可能,揭示了潜在的治疗靶点。
- 知识库支持对药物、基因与疾病之间关系的交互式探索,促进了药物重定位的假说生成。
- 该系统展示了在公共卫生紧急情况下,通过自动化大规模文献挖掘实现快速生物医学知识发现的可行性。
- 该知识库对公众开放,并已被同行评审研究引用,验证了其在科学界中的实用性和可靠性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。