[论文解读] Lipophilicity Prediction with Multitask Learning and Molecular Substructures Representation
本文提出 StructGNN,一种多任务图神经网络,通过将分子亚结构编码为广义超原子,并与 D-MPNN 主干网络结合,提升了亲脂性预测性能。该方法在 logP 和 logD 预测任务上达到当前最优性能,RMSE 分别为 0.425 和 0.537,显著优于先前模型(包括 OT-GNN 和 D-MPNN),尤其在对称分子上的表现更为突出。
Lipophilicity is one of the factors determining the permeability of the cell membrane to a drug molecule. Hence, accurate lipophilicity prediction is an essential step in the development of new drugs. In this paper, we introduce a novel approach to encoding additional graph information by extracting molecular substructures. By adding a set of generalized atomic features of these substructures to an established Direct Message Passing Neural Network (D-MPNN) we were able to achieve a new state-of-the-art result at the task of prediction of two main lipophilicity coefficients, namely logP and logD descriptors. We further improve our approach by employing a multitask approach to predict logP and logD values simultaneously. Additionally, we present a study of the model performance on symmetric and asymmetric molecules, that may yield insight for further research.
研究动机与目标
- 通过增强分子表示学习,提升药物发现中亲脂性预测的准确性。
- 通过亚结构编码引入全局功能团信息,解决图神经网络中局部消息传递的局限性。
- 探究对称分子与非对称分子在分子性质预测中的性能差距。
- 探索同时预测相关描述符 logP 和 logD 时,多任务学习带来的优势。
- 通过新颖且可解释的亚结构表示,建立 logP 和 logD 预测的新最先进基准。
提出的方法
- 模型采用双编码器架构:D-MPNN 编码器用于局部原子消息传递,亚结构编码器用于捕捉全局功能团特征。
- 分子亚结构(环、胺、酸、酯、磺酰胺)被表示为超原子,其广义特征由组成原子推导得出。
- 亚结构特征包括原子类型计数、形式电荷、芳香性、杂化状态及原子质量总和,通过单层前馈网络编码。
- 最终分子嵌入由 D-MPNN 输出与平均化后的亚结构嵌入拼接而成。
- 引入多任务学习目标,采用平衡的 RMSE 损失函数,可处理 logP 或 logD 值缺失的情况,并联合优化两个目标。
- 模型使用 RMSE 损失进行训练,并在包含 17,603 个唯一 SMILES 的联合数据集上进行评估,其中 251 个分子同时具有 logP 和 logD 值。
实验结果
研究问题
- RQ1将分子亚结构编码为广义超原子是否能提升图神经网络在亲脂性预测中的性能?
- RQ2对 logP 和 logD 进行多任务学习是否能带来比单任务学习更好的泛化能力与性能提升?
- RQ3不同模型在对称分子与非对称分子上的表现如何?其性能差异的成因是什么?
- RQ4将亚结构级别特征与 D-MPNN 融合是否能降低预测误差,特别是在具有挑战性的分子模式上?
- RQ5现有模型在预测对称分子的 logP 和 logD 时是否存在显著性能差距?该差距是否可被缓解?
主要发现
- StructGNN 在 logP 预测上达到新的最先进 RMSE 为 0.425 ± 0.005,优于此前最先进模型 OT-GNN(0.508 ± 0.016)和 D-MPNN(0.464 ± 0.002)。
- 在 logD 预测上,StructGNN 的 RMSE 为 0.537 ± 0.008,优于 OT-GNN(0.735 ± 0.114)和 D-MPNN(0.601 ± 0.008)。
- 多任务版本的 StructGNN 进一部提升性能,logP 的 RMSE 为 0.425 ± 0.005,logD 的 RMSE 为 0.537 ± 0.008,决定系数 R² 分别为 0.948 和 0.817。
- 所有模型(包括表现最佳的 StructGNN)在对称分子上的误差均显著更高,logP 的 RMSE 达到 0.671 ± 0.017,logD 达到 1.113 ± 0.147。
- 多任务方法降低了对称分子上的误差,StructGNN+Multitask 在对称 logP 上达到 RMSE 0.541 ± 0.005,在对称 logD 上达到 0.367 ± 0.113,表明鲁棒性得到提升。
- 研究发现,对称分子仍是持续存在的挑战,没有任何模型在该子集上对两个描述符均持续表现更优,表明存在根本性的建模差距。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。