[论文解读] Tri-graph Information Propagation for Polypharmacy Side Effect Prediction
该论文提出了一种新型图神经网络模型——三图信息传播(TIP),通过在蛋白质-蛋白质图上顺序学习蛋白质表征,将这些表征通过蛋白质-药物图传播至药物,再在药物-药物相互作用图上精炼药物表征,从而提升多药物副作用(POSE)预测性能。TIP在AUPRC上比最先进的模型(如Decagon)高出7.2%,同时训练时间减少83倍,内存使用量降低3倍。
The use of drug combinations often leads to polypharmacy side effects (POSE). A recent method formulates POSE prediction as a link prediction problem on a graph of drugs and proteins, and solves it with Graph Convolutional Networks (GCNs). However, due to the complex relationships in POSE, this method has high computational cost and memory demand. This paper proposes a flexible Tri-graph Information Propagation (TIP) model that operates on three subgraphs to learn representations progressively by propagation from protein-protein graph to drug-drug graph via protein-drug graph. Experiments show that TIP improves accuracy by 7%+, time efficiency by 83$ imes$, and space efficiency by 3$ imes$.
研究动机与目标
- 解决现有基于图卷积网络(GCN)的多药物副作用(POSE)预测模型的高计算与内存开销问题,特别是Decagon的全图学习方法。
- 通过利用药理学和蛋白质-蛋白质相互作用数据作为辅助信号,聚焦于药物-药物相互作用预测,从而提升预测准确性。
- 通过将蛋白质和药物表征学习解耦为独立、渐进的子图模块,提升模型效率。
- 通过在三个不同子图(P-P、P-D和D-D)之间分层传播信息,实现对多模态生物医学图的灵活建模。
- 证明从蛋白质到药物的聚焦式、多阶段传播相比联合端到端图学习,在性能和效率方面均更优。
提出的方法
- 从一个多模态生物医学图中构建三个子图:蛋白质-蛋白质(P-P)图、蛋白质-药物(P-D)图,以及带有副作用标签的药物-药物(D-D)相互作用图。
- 应用图卷积网络(GCN)模块(PPM)在P-P图上学习蛋白质节点表征,使用ReLU激活函数和对邻居节点的归一化聚合。
- 使用图到图的信息传播(GGM)模块,通过P-D图将学习到的蛋白质表征传递至药物节点,采用单层消息传递神经网络(MPNN),结合ReLU激活函数和邻域平均聚合。
- 通过拼接(TIP-cat)或逐元素求和(TIP-sum)的方式,将传播的蛋白质信息与原始药物特征结合,形成增强的药物表征。
- 在最终的药物表征上训练解码器(可微分特征基或神经网络基),以预测D-D图上的副作用发生概率。
- 使用交叉熵损失进行端到端优化,通过分阶段训练蛋白质和药物表征学习,以降低内存和计算负载。
实验结果
研究问题
- RQ1与联合图学习相比,多阶段、子图特定的信息传播框架是否能提升POSE预测的准确性?
- RQ2将蛋白质和药物表征学习分离在多大程度上能降低大规模POSE预测中的计算与内存开销?
- RQ3通过P-D图传播蛋白质水平的药理学信息,在增强药物-药物相互作用预测方面有多有效?
- RQ4通过P-D图从P-P到D-D的分层传播是否优于在全图上直接联合建模?
- RQ5当最终解码器未显式使用药理学特征时,该模型是否仍能对具有分子起源的副作用实现良好泛化?
主要发现
- TIP-cat和TIP-sum在AUPRC上达到8.90,AUROC为91.4%,AP@50为89.0%,相比Decagon在AUPRC上提升7.2%,在AUROC和AP@50上也显著更优。
- 与Decagon相比,TIP将训练时间减少98.9%(从约9600秒降至约115秒/周期),峰值GPU内存使用量降低66.1%(从>28GB降至9.47GB)。
- TIP在保持准确率的前提下,实现3倍的内存消耗降低和83倍的训练速度提升,展现出显著的效率优势。
- TIP-sum与TIP-cat表现相当,表明拼接和逐元素求和两种操作均能有效将蛋白质衍生信息整合进药物表征。
- PPM-GGM-NN架构(即TIP)优于dTIP_P和dTIP_D,表明联合建模蛋白质与药物信息对实现最优性能至关重要。
- 可微分特征(DF)解码器在准确率上比神经网络(NN)解码器高11.5%,时间成本降低43.9%,尽管需要更多内存,凸显了速度与内存使用之间的权衡。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。