[论文解读] Coronavirus Knowledge Graph: A Case Study
本文提出了一种使用BioBERT进行命名实体识别,并基于PubMed和CORD-19数据集,采用共现频率和余弦相似度两种方法构建的冠状病毒知识图谱(CKG),以提取与药物、基因和化学物质相关的实体。其主要贡献在于提出了一套系统化、可扩展的框架,用于识别与SARS-CoV-2相关的潜在药物候选物及生物关系,初步结果表明,法维拉宾、洛匹那韦和利巴韦林等药物存在生物上合理的关联。
The emergence of the novel COVID-19 pandemic has had a significant impact on global healthcare and the economy over the past few months. The virus's rapid widespread has led to a proliferation in biomedical research addressing the pandemic and its related topics. One of the essential Knowledge Discovery tools that could help the biomedical research community understand and eventually find a cure for COVID-19 are Knowledge Graphs. The CORD-19 dataset is a collection of publicly available full-text research articles that have been recently published on COVID-19 and coronavirus topics. Here, we use several Machine Learning, Deep Learning, and Knowledge Graph construction and mining techniques to formalize and extract insights from the PubMed dataset and the CORD-19 dataset to identify COVID-19 related experts and bio-entities. Besides, we suggest possible techniques to predict related diseases, drug candidates, gene, gene mutations, and related compounds as part of a systematic effort to apply Knowledge Discovery methods to help biomedical researchers tackle the pandemic.
研究动机与目标
- 为应对在迅速扩大的COVID-19生物医学文献中系统性知识发现的迫切需求。
- 开发一种可扩展的方法,从非结构化文本中提取并组织生物医学实体(药物、基因、化学物质)。
- 构建一个动态、可查询的知识图谱,支持药物再利用和专家识别等下游任务。
- 评估并比较两种知识图谱构建技术——共现频率与余弦相似度——在捕捉相关生物关系方面的表现。
- 为SARS-CoV-2研究背景下药物、疾病和专家的自动化画像系统奠定基础。
提出的方法
- 利用BioBERT(一种针对生物医学NLP微调的BERT模型)对PubMed和CORD-19数据集执行命名实体识别(NER)。
- 通过Word2Vec生成实体的密集向量表示,用于相似度计算。
- 采用两种不同方法构建知识图谱:(1) 在滑动窗口内计算实体的共现频率;(2) 计算实体嵌入向量之间的余弦相似度。
- 使用Gephi软件可视化以药物为中心的知识图谱,其中节点代表实体,边表示相似度或共现关系。
- 应用余弦相似度公式:$ \text{cos}(\mathbf{S}, \mathbf{T}) = \frac{\sum_{i=1}^{n}{{\bf S}_{i}{\bf T}_{i}}}{\sqrt{\sum_{i=1}^{n}{({\bf S}_{i})^{2}}}\sqrt{\sum_{i=1}^{n}{({\bf T}_{i})^{2}}}} $ 来量化实体之间的关系。
- 通过定性分析每种药物的高分实体,评估其生物合理性与对SARS-CoV-2的相关性。
实验结果
研究问题
- RQ1在新兴病毒大流行背景下,BioBERT在从CORD-19和PubMed数据集中提取生物医学实体方面的有效性如何?
- RQ2在捕捉药物、基因和化学物质之间有意义的生物关系方面,共现频率与余弦相似度哪种知识图谱构建方法更优?
- RQ3所构建的知识图谱能否识别出生物上合理且可能具有再利用潜力的药物候选物用于治疗COVID-19?
- RQ4以药物为中心的知识图谱中,排名靠前的基因和化学实体在多大程度上与SARS-CoV-2的已知生物学机制一致?
- RQ5如何利用知识图谱在大流行研究中设计一种可扩展的自动化系统,对药物、疾病和专家进行画像?
主要发现
- BioBERT成功从CORD-19和PubMed数据集中提取了大量生物医学实体,但因训练数据多样性不足,CORD-19中的实体多样性有限。
- 基于余弦相似度的知识图谱揭示了生物上合理的关联关系:例如,法维拉宾与鸟嘌呤、赖氨酸和脯氨酸最为相似,这些物质在结构或生物学功能上具有相关性。
- 洛匹那韦与神经氨酸酶、p53和IFITM3相关联,这些基因和蛋白与病毒复制及宿主免疫应答有关。
- 利巴韦林与毒性、p53和炎症表现出强烈关联,与其已知的副作用和抗病毒机制一致。
- 利托那韦和奥司他韦与JNK、STAT3和干扰素相关基因相关联,提示其可能具有调节免疫反应的作用,与SARS-CoV-2相关。
- 以药物为中心的知识图谱生成了稳定、可解释且具有生物相关性的实体聚类,支持其在药物再利用和系统生物学分析中的实用性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。