Skip to main content
QUICK REVIEW

[论文解读] Information Mining for COVID-19 Research From a Large Volume of Scientific Literature

Sabber Ahamed, Manar D. Samad|arXiv (Cornell University)|Apr 4, 2020
Computational Drug Discovery Methods被引用 16
一句话总结

本文提出一种基于图的文本挖掘方法,利用介数中心性从10,683篇冠状病毒科学摘要中提取并排序关键关键词,识别出关键药物、病原体、宿主及生物分子。该方法揭示了干扰素、金刚烷胺和猪等高优先级候选物,为COVID-19研究中现有治疗药物的再利用提供了可操作的见解。

ABSTRACT

The year 2020 has seen an unprecedented COVID-19 pandemic due to the outbreak of a novel strain of coronavirus in 180 countries. In a desperate effort to discover new drugs and vaccines for COVID-19, many scientists are working around the clock. Their valuable time and effort may benefit from computer-based mining of a large volume of health science literature that is a treasure trove of information. In this paper, we have developed a graph-based model using abstracts of 10,683 scientific articles to find key information on three topics: transmission, drug types, and genome research related to coronavirus. A subgraph is built for each of the three topics to extract more topic-focused information. Within each subgraph, we use a betweenness centrality measurement to rank order the importance of keywords related to drugs, diseases, pathogens, hosts of pathogens, and biomolecules. The results reveal intriguing information about antiviral drugs (Chloroquine, Amantadine, Dexamethasone), pathogen-hosts (pigs, bats, macaque, cynomolgus), viral pathogens (zika, dengue, malaria, and several viruses in the coronaviridae virus family), and proteins and therapeutic mechanisms (oligonucleotide, interferon, glycoprotein) in connection with the core topic of coronavirus. The categorical summary of these keywords and topics may be a useful reference to expedite and recommend new and alternative directions for COVID-19 research.

研究动机与目标

  • 解决SARS-CoV-2及其相关冠状病毒科学文献迅速增长带来的信息过载挑战。
  • 从摘要中识别潜在的、主题特定的关键词及其关系,以支持药物再利用和新研究方向的探索。
  • 开发一种可扩展的基于图的计算模型,通过中心性对关键词进行排序,突出在传播、药物类型和基因组研究中最具影响力的术语。
  • 为研究人员提供一个参考框架,通过揭示病毒学、药理学及宿主-病原体相互作用中被忽视的关联,加速发现进程。

提出的方法

  • 利用词共现和句法关系从10,683篇科学论文摘要构建知识图谱。
  • 创建三个主题特定的子图:传播、药物类型和基因组研究,每个子图均以中心节点'coronavirus'为锚点。
  • 应用介数中心性(BC)根据节点在网络中作为其他节点间最短路径经过的频率,对关键词进行结构重要性排序。
  • 将排序后的关键词按类别分组:疾病、宿主、生物分子和杂项,以增强可解释性和主题分析。
  • 在构建图谱前,使用自然语言处理技术提取并规范化术语,如药物、病毒、蛋白质和宿主物种。
  • 通过排序列表和子图分析进行结果可视化,突出高影响力术语和潜在的研究线索。

实验结果

研究问题

  • RQ1在科学文献中,哪些药物、病原体和宿主物种与冠状病毒的关联频率最高且结构上最核心?
  • RQ2在冠状病毒研究背景下,哪些生物分子和治疗机制表现出高度连接性?
  • RQ3在基于文献构建的知识图谱中,介数中心性如何揭示现有抗病毒药物与病毒家族研究之间的隐藏关联?
  • RQ4基于图的关键词排序能否识别出SARS-CoV-2背景下具有前景的药物再利用候选物?
  • RQ5网络结构如何凸显宿主-病原体关系或遗传机制中的特定模式?

主要发现

  • 在抗流感病毒治疗的药物子图中,金刚烷胺的中心性高于氯喹,提示其在SARS-CoV-2中具有潜在的再利用价值。
  • 猪在传播和基因子图中均被识别为关键宿主,与猪流行性腹泻病毒(PEDV)和猪血凝素-酯酶病毒(PHEV)相关。
  • 干扰素(IFN)在基因子图中位列第四大最具影响力的生物分子,在杂项类别中位列第二,表明其在抗病毒反应中的核心作用。
  • 小鼠在宿主中排名第一,其次是蝙蝠、猫和猕猴,进一步证实其在冠状病毒感染的临床前模型中的应用价值。
  • 聚合酶链式反应(PCR)在生物分子类别中排名第二,仅次于RNA,凸显其在冠状病毒分子诊断中的关键作用。
  • 在基因子图中,'cancer'的高中心性提示其与癌症基因组研究和流感病毒之间可能存在潜在关联,其后依次为SARS和流感。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。