[论文解读] CASTER: Predicting Drug Interactions with Chemical Substructure Representation
CASTER 是一种深度学习框架,通过利用从分子结构中提取的化学亚结构表示来预测药物-药物相互作用(DDI)。它通过结合序列模式挖掘以提取功能亚结构、自编码以利用有标签和无标签数据进行泛化,以及字典学习为亚结构分配可解释的系数,从而提升预测准确性和可解释性,在两个真实世界的DDI数据集上优于最先进模型。
Adverse drug-drug interactions (DDIs) remain a leading cause of morbidity and mortality. Identifying potential DDIs during the drug design process is critical for patients and society. Although several computational models have been proposed for DDI prediction, there are still limitations: (1) specialized design of drug representation for DDI predictions is lacking; (2) predictions are based on limited labelled data and do not generalize well to unseen drugs or DDIs; and (3) models are characterized by a large number of parameters, thus are hard to interpret. In this work, we develop a ChemicAl SubstrucTurE Representation (CASTER) framework that predicts DDIs given chemical structures of drugs.CASTER aims to mitigate these limitations via (1) a sequential pattern mining module rooted in the DDI mechanism to efficiently characterize functional sub-structures of drugs; (2) an auto-encoding module that leverages both labelled and unlabelled chemical structure data to improve predictive accuracy and generalizability; and (3) a dictionary learning module that explains the prediction via a small set of coefficients which measure the relevance of each input sub-structures to the DDI outcome. We evaluated CASTER on two real-world DDI datasets and showed that it performed better than state-of-the-art baselines and provided interpretable predictions.
研究动机与目标
- 为解决现有药物表示方法缺乏针对DDI预测的专门设计,这些方法常忽略对相互作用机制至关重要的功能亚结构。
- 通过利用有标签和无标签的化学数据(包括药物-食物相互作用)提升模型泛化能力,减少偏差,并增强对未见药物对的预测性能。
- 通过字典学习模块识别导致DDI的关键亚结构,为亚结构分配相关性系数,提供可解释的预测结果。
- 通过提供人类可读的预测结果解释,克服深度学习模型在DDI预测中的黑箱问题。
提出的方法
- 使用序列模式挖掘从SMILES格式的分子结构中提取功能亚结构(如功能基团),基于已知的DDI机制。
- 采用自编码模块,从有标签和无标签的药物对中学习低维嵌入表示,提升表示的泛化能力。
- 应用字典学习,将药物对投影到由频繁亚结构定义的子空间上,生成稀疏系数以指示亚结构对DDI结果的相关性。
- 集成放大岭回归层,通过将系数放大100倍来加速训练,提升收敛速度,同时不改变模型行为。
- 通过RDKit处理SMILES字符串以进行标准化,并过滤掉无法处理的条目,以确保数据质量,再进行亚结构提取。
- 采用五折交叉验证并使用多个随机种子,以确保评估的稳健性,并报告平均性能及标准差。
实验结果
研究问题
- RQ1与使用完整分子表示的模型相比,基于亚结构的表示框架是否能提升DDI预测的准确性?
- RQ2在模型中引入无标签数据(如药物-食物对)在多大程度上能增强DDI预测模型的泛化能力?
- RQ3字典学习模块能否生成可解释的、稀疏的系数,以突出显示导致DDI的化学上有意义的亚结构?
- RQ4可解释性结果在不同随机初始化和多样的DDI案例中是否具有鲁棒性?
- RQ5CASTER在预测性能和可解释性方面是否优于最先进模型(如DeepDDI、mol2vec和分子VAE)?
主要发现
- CASTER对西地那非-单硝酸异山梨酯相互作用的置信度得分为0.7928,表明对这一已知高风险DDI的强预测能力。
- 硝酸酯功能基团(O=[N+](O-))获得了最高的系数(放大后为8.25),与已知的药理学DDI机制一致。
- 在五种基于硝酸酯的药物中,硝酸酯基团的平均系数比其他亚结构的平均值高出50%,证实了其非随机且具有生物学合理性的归因。
- 在不同随机种子进行的五次运行中,系数相关性矩阵的平均相关系数为0.7673,表明可解释性结果具有稳健性和稳定性。
- CASTER在两个真实世界的DDI数据集上,其预测准确性优于最先进基线模型(如DeepDDI、mol2vec和分子VAE)。
- 该框架通过利用无标签的药物-食物相互作用数据来增强表示学习,从而提升了泛化能力,且无需外部知识。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。