[论文解读] Deep Graph Convolutional Network and LSTM based approach for predicting drug-target binding affinity
本文提出 DeepGLSTM,一种结合图卷积网络(GCN)与双向长短期记忆(Bi-LSTM)网络的新型深度学习模型,用于预测药物-靶标结合亲和力。该模型利用药物的多尺度幂图表示和 Bi-LSTM 处理由氨基酸序列构成的蛋白质数据,实现在多个数据集上的最先进性能,并识别出 18 种与 SARS-CoV-2 病毒蛋白具有高亲和力的美国食品药品管理局(FDA)批准药物。
Development of new drugs is an expensive and time-consuming process. Due to the world-wide SARS-CoV-2 outbreak, it is essential that new drugs for SARS-CoV-2 are developed as soon as possible. Drug repurposing techniques can reduce the time span needed to develop new drugs by probing the list of existing FDA-approved drugs and their properties to reuse them for combating the new disease. We propose a novel architecture DeepGLSTM, which is a Graph Convolutional network and LSTM based method that predicts binding affinity values between the FDA-approved drugs and the viral proteins of SARS-CoV-2. Our proposed model has been trained on Davis, KIBA (Kinase Inhibitor Bioactivity), DTC (Drug Target Commons), Metz, ToxCast and STITCH datasets. We use our novel architecture to predict a Combined Score (calculated using Davis and KIBA score) of 2,304 FDA-approved drugs against 5 viral proteins. On the basis of the Combined Score, we prepare a list of the top-18 drugs with the highest binding affinity for 5 viral proteins present in SARS-CoV-2. Subsequently, this list may be used for the creation of new useful drugs.
研究动机与目标
- 开发一种深度学习模型,以提升药物-靶标结合亲和力的预测性能,从而加快药物重新定位进程。
- 解决现有模型在捕捉药物和蛋白质数据的拓扑结构与序列信息方面的局限性。
- 识别出与 SARS-CoV-2 病毒蛋白具有高亲和力的 FDA 批准药物,以用于重新定位。
- 在包括 Davis、KIBA、DTC、Metz、ToxCast 和 STITCH 在内的多个基准数据集上评估模型性能。
提出的方法
- 该模型使用三个堆叠的 GCN 模块,结合幂图表示(A、A²、A³),从 SMILES 表示中捕捉药物分子的多尺度拓扑特征。
- 双向长短期记忆网络(Bi-LSTM)用于处理蛋白质氨基酸序列,以学习序列数据中的上下文信息和长距离依赖关系。
- 通过整合 pKd 和 KIBA 分数,引入综合评分(Cb),以提升结合亲和力预测的一致性。
- 模型在六个公开数据集(Davis、KIBA、DTC、Metz、ToxCast 和 STITCH)上进行端到端训练。
- 通过消融研究评估各组件(包括 GCN 模块和 Bi-LSTM)的贡献,以均方误差(MSE)作为评估指标。
- 最终模型被应用于预测 2,304 种 FDA 批准药物与五种 SARS-CoV-2 病毒蛋白之间的结合亲和力。
实验结果
研究问题
- RQ1混合 GCN-Bi-LSTM 架构是否能在预测药物-靶标结合亲和力方面优于现有模型?
- RQ2不同的幂图表示(A、A²、A³)在捕捉药物分子结构信息方面有何贡献?
- RQ3GCN 模块与 Bi-LSTM 在分别建模药物和蛋白质特征方面,其相对贡献如何?
- RQ4所提出的综合评分(Cb)是否能提升在多样化结合亲和力度量下的预测一致性?
- RQ5哪些 FDA 批准药物对 SARS-CoV-2 病毒蛋白表现出最高的预测结合亲和力?
主要发现
- DeepGLSTM 在 Davis、KIBA、DTC、Metz、ToxCast 和 STITCH 数据集上均达到最先进性能,优于基线模型(如 GraphDTA)。
- 消融研究显示,使用 A³ 输入的第三个 GCN 模块和 Bi-LSTM 对模型性能的提升贡献最大。
- 与单输入变体相比,使用多尺度幂图输入(A、A²、A³)时,模型的均方误差(MSE)显著降低。
- 异丙肾上腺素、美地噻松、林丹、美沙酰胺、氧苯甲酮、吗啡、雌三醇、L-薄荷醇、维生素 D2 和甲氧苯胺被识别为具有高 Cb 评分的高亲和力受体结合药物。
- 乳果糖、山梨醇、米卡酸、愈创木酚、氰醇、甘露醇、羟基苯甲酸、苯甲酸被识别为具有高 Cb 评分的高亲和力非受体结合药物。
- 本研究为实验验证提供了 18 种高亲和力药物的优先列表,作为潜在治疗 SARS-CoV-2 的候选药物。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。