[论文解读] Explaining Chemical Toxicity using Missing Features
本文提出使用对比解释方法(CEM)通过识别影响模型预测的毒性药效团(相关正例)和缺失的结构特征(相关负例),来解释化学毒性预测。通过使用FISTA优化最小扰动,CEM揭示了其存在或缺失会导致毒性标签翻转的亚结构,生成与已知毒性药效团一致的解释,从而提升基于深度学习的毒性预测模型的可解释性。
Chemical toxicity prediction using machine learning is important in drug development to reduce repeated animal and human testing, thus saving cost and time. It is highly recommended that the predictions of computational toxicology models are mechanistically explainable. Current state of the art machine learning classifiers are based on deep neural networks, which tend to be complex and harder to interpret. In this paper, we apply a recently developed method named contrastive explanations method (CEM) to explain why a chemical or molecule is predicted to be toxic or not. In contrast to popular methods that provide explanations based on what features are present in the molecule, the CEM provides additional explanation on what features are missing from the molecule that is crucial for the prediction, known as the pertinent negative. The CEM does this by optimizing for the minimum perturbation to the model using a projected fast iterative shrinkage-thresholding algorithm (FISTA). We verified that the explanation from CEM matches known toxicophores and findings from other work.
研究动机与目标
- 通过识别导致毒性的特征以及其缺失可防止毒性的特征,提升计算毒理学中深度学习模型的可解释性。
- 通过引入相关负例(缺失的亚结构)来解决现有可解释AI方法仅关注存在特征的局限性,这些缺失的亚结构对预测至关重要。
- 验证CEM生成的解释是否与已知毒性药效团及化学毒性预测中的实验发现一致。
- 展示CEM可通过建议对毒性分子进行最小结构修改,将其转化为非毒性分子,从而为分子设计提供可操作的见解。
- 将毒性解释的范围从结构警报扩展至关于分子转化的可操作洞察。
提出的方法
- 将CEM应用于在SR-MMP(线粒体膜电位破坏)任务中基于分子结构训练的深度神经网络(DNN)模型。
- 该方法将相关正例(PPs)识别为导致毒性预测的最小特征集合。
- 该方法将相关负例(PNs)识别为防止毒性预测的最小特征集合,代表缺失的毒性药效团。
- 通过投影快速迭代软阈值化算法(FISTA)进行优化,以找到使模型预测翻转的最小输入分子扰动。
- 通过分析使模型输出发生改变所需的最小变化,推导出特征重要性,重点关注官能团和亚结构等结构片段。
- 将解释与文献中已知的毒性药效团进行验证,包括酚羟基、脂肪族卤化物、多环芳烃体系和芳香硝基基团。
实验结果
研究问题
- RQ1CEM能否识别出解释某分子被预测为有毒或非毒性的现有和缺失的结构特征?
- RQ2CEM识别出的相关负例(缺失特征)是否对应于化学毒性中的已知毒性药效团或结构警报?
- RQ3CEM生成的解释与分子毒性的既定实验发现相比如何?
- RQ4CEM能否通过建议对毒性分子进行最小修改以转化为非毒性分子,为分子设计提供可操作的见解?
- RQ5CEM的解释在多大程度上与已知毒性机制一致,例如酚羟基在破坏线粒体膜电位中的作用?
主要发现
- CEM成功在如酪蛋白9号和23号等分子中将酚羟基识别为相关正例,与实验发现一致,表明该基团有助于毒性。
- 该方法检测到已知毒性药效团(如脂肪族卤化物、多环芳烃体系和芳香硝基基团)既作为相关正例也作为相关负例,证实与既定毒理学知识的一致性。
- 对于2,6-二氯苯酚,CEM将酚羟基和氯取代基识别为相关正例,解释了其被错误预测为有毒的原因。
- 相关负例被发现代表缺失的毒性药效团——例如,非毒性分子中缺乏酚羟基——为某些分子被预测为非毒性提供了洞察。
- CEM的解释与弱酸性化合物通过酚羟基基团破坏线粒体膜电位的机制一致。
- 该模型表明,CEM可在单一框架中生成正负双重解释,通过识别缺失的毒性药效团,实现更安全分子的反向设计。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。