Skip to main content
QUICK REVIEW

[论文解读] Partial Product Aware Machine Learning on DNA-Encoded Libraries

P. Binder, Meghan Lawler|arXiv (Cornell University)|May 16, 2022
Chemical Synthesis and Analysis被引用 6
一句话总结

该论文提出了一种基于图神经网络(GNN)的机器学习模型,明确考虑了DNA编码文库(DELs)中的部分产物和反应收率,从而提高了预测准确性和泛化能力。通过结合实验测得的收率来建模完整产物和部分产物的比例,该方法在外部化合物虚拟筛选中优于仅使用三聚体或恒定收率的模型。

ABSTRACT

DNA encoded libraries (DELs) are used for rapid large-scale screening of small molecules against a protein target. These combinatorial libraries are built through several cycles of chemistry and DNA ligation, producing large sets of DNA-tagged molecules. Training machine learning models on DEL data has been shown to be effective at predicting molecules of interest dissimilar from those in the original DEL. Machine learning chemical property prediction approaches rely on the assumption that the property of interest is linked to a single chemical structure. In the context of DNA-encoded libraries, this is equivalent to assuming that every chemical reaction fully yields the desired product. However, in practice, multi-step chemical synthesis sometimes generates partial molecules. Each unique DNA tag in a DEL therefore corresponds to a set of possible molecules. Here, we leverage reaction yield data to enumerate the set of possible molecules corresponding to a given DNA tag. This paper demonstrates that training a custom GNN on this richer dataset improves accuracy and generalization performance.

研究动机与目标

  • 解决现有DEL ML模型的局限性,即假设反应收率为100%且忽略部分产物。
  • 通过在DEL中同时建模完整(三聚体)和部分(二聚体、单聚体)产物,提高预测准确性和泛化能力。
  • 利用实验测得的反应收率而非假设恒定收率,以更准确地表示分子混合物的比例。
  • 在外部供应商化合物上评估模型性能,以评估其在真实场景中的泛化能力。

提出的方法

  • 该模型使用单一GNN,基于分子结构预测完整产物和部分产物(三聚体、二聚体、单聚体)的富集分数。
  • 它结合了验证实验中获得的反应收率数据,以估算每个DNA条形码对应各类产物的比例。
  • 损失函数采用负二项分布似然,结合目标组和无靶对照(NTC)计数,并对富集分数平方值施加正则化项。
  • 模型在训练过程中学习产物比例的调整,以应对实验室纯化过程中的噪声。
  • 按每个DNA条形码汇总各类产物的富集分数,以预测最终的测序读数。
  • 模型在内部DEL数据上进行训练,并在保留的测试集和包含150种供应商化合物的外部数据集上进行评估。

实验结果

研究问题

  • RQ1在DNA编码文库中建模部分产物是否能提高机器学习预测准确性,相较于仅考虑完整产物的模型?
  • RQ2与恒定收率相比,使用实验测得的反应收率是否能提升模型在外部化合物上的泛化能力?
  • RQ3包含二聚体产物如何影响模型性能和DEL数据中的噪声降低?
  • RQ4学习产物比例调整在多大程度上提升了模型对实验噪声的鲁棒性?

主要发现

  • 包含完整和部分产物并采用学习收率调整的完整模型在测试数据上取得了最高的R²分数,优于仅使用三聚体或恒定收率的模型。
  • 采用学习收率调整的模型在测试数据上表现更优,表明其能更好地处理多轮纯化过程带来的噪声。
  • 在包含150种外部供应商化合物的数据集上,采用学习收率的完整模型取得了最高的ROC曲线下面积(AUC),证明其泛化能力更优。
  • 在预测的前10名结合剂中,采用实验室测得收率并结合学习调整的模型命中率最高,证实其在虚拟筛选中的有效性。
  • 仅使用二聚体的模型表现优于仅使用三聚体的模型,表明部分产物携带有意义的结合信号,而非仅仅是噪声。
  • 与采用测得或学习收率的模型相比,使用恒定收率的模型性能略有下降,凸显了准确建模产物比例的重要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。