Skip to main content
QUICK REVIEW

[论文解读] Adaptive Invariance for Molecule Property Prediction

Wengong Jin, Regina Barzilay|arXiv (Cornell University)|May 5, 2020
COVID-19 diagnosis using AI参考文献 10被引用 4
一句话总结

该论文提出了一种名为自适应不变性(Adaptive Invariance)的新方法,用于分子性质预测,通过动态生成扰动的潜在表征来突出和抑制无关变化,从而提升在异质数据上的泛化能力。通过将不变风险最小化方法与支架引导的、持续调整的环境相结合,该模型在 SARS-CoV-2 抗病毒活性预测任务上相较于最先进方法实现了 16% 的相对 AUROC 提升,在 SARS-CoV-1 和分子片段筛选等有限且碎片化的数据源上,也优于迁移学习基线方法。

ABSTRACT

Effective property prediction methods can help accelerate the search for COVID-19 antivirals either through accurate in-silico screens or by effectively guiding on-going at-scale experimental efforts. However, existing prediction tools have limited ability to accommodate scarce or fragmented training data currently available. In this paper, we introduce a novel approach to learn predictors that can generalize or extrapolate beyond the heterogeneous data. Our method builds on and extends recently proposed invariant risk minimization, adaptively forcing the predictor to avoid nuisance variation. We achieve this by continually exercising and manipulating latent representations of molecules to highlight undesirable variation to the predictor. To test the method we use a combination of three data sources: SARS-CoV-2 antiviral screening data, molecular fragments that bind to SARS-CoV-2 main protease and large screening data for SARS-CoV-1. Our predictor outperforms state-of-the-art transfer learning methods by significant margin. We also report the top 20 predictions of our model on Broad drug repurposing hub.

研究动机与目标

  • 为解决在训练数据稀缺、碎片化或来自不同化学空间或病毒靶点时,分子性质预测的外推挑战。
  • 通过强制对支架差异或分子片段大小等无关变化保持不变,提升分子性质预测的泛化能力。
  • 开发一种动态自适应的不变风险最小化(IRM)变体,通过潜在表征而非静态域划分来生成演化环境。
  • 在真实世界的 SARS-CoV-2 抗病毒筛选数据(包括片段和 SARS-CoV-1 数据)上评估该方法,以证明其鲁棒性和外推能力。

提出的方法

  • 该方法通过在相同训练化合物上施加持续调整的扰动,基于支架分类器动态定义两个环境,从而在潜在表征上实现动态环境构建。
  • 扰动设计旨在推动潜在表征向更具通用性的共享特征靠拢,从而突出模型必须忽略的无关变化。
  • 使用支架分类器引导扰动过程,确保模型学习忽略与目标性质无关的支架特异性模式。
  • 采用改进的不变风险最小化目标进行模型训练,以鼓励预测器在这些动态定义的环境中保持不变性。
  • 该方法将多源数据——SARS-CoV-2 完整分子、SARS-CoV-2 片段和 SARS-CoV-1 筛选数据——整合进统一的训练框架。
  • 采用 10 个模型的集成,通过 10 折交叉验证进行训练,最终对 Broad Drug Repurposing Hub 上的性质预测结果取平均作为最终得分。

实验结果

研究问题

  • RQ1当在来自不同来源(如片段和 SARS-CoV-1)的有限异质数据上进行训练时,机器学习模型是否能够泛化以预测 SARS-CoV-2 抗病毒活性?
  • RQ2如何将不变风险最小化方法动态地、数据驱动地适应组合复杂、与分子相关的描述符(如支架)?
  • RQ3在潜在空间中动态创建环境在多大程度上能提升模型鲁棒性和外推能力,超越标准的域自适应或迁移学习方法?
  • RQ4在有限标注数据下,强制对支架层面变化保持不变是否能提升下游性质预测任务的性能?

主要发现

  • 所提出的方法在 SARS-CoV-2 抗病毒活性预测任务上取得了 0.8930 的 AUROC 得分,相较于最佳基线方法实现了 8–16% 的相对提升。
  • 在 Mpro 抑制任务中,模型取得了 0.7955 的 AUROC,显著优于次优方法(0.7841),展现出在不同数据源间的强大泛化能力。
  • 模型在抗病毒预测任务中 AUROC 达到 0.8146,优于领域对抗训练(DANN)的 0.8067,也优于标准 IRM 方法。
  • 消融实验表明,使用 SARS-CoV-1 数据进行训练可提升在 SARS-CoV-2 抗病毒预测中的性能(AUROC 为 0.8067),优于仅使用 SARS-CoV-2 数据训练的结果(AUROC 为 0.7404),证实了跨病毒的相关性。
  • 该模型识别出 20 种具有高潜力的 SARS-CoV-2 重新定位候选化合物,包括化合物 C[C@]12CC(=O)[C@H]3[C@@H](CCC4=CC(=O)CC[C@]34C)[C@@H]1CC[C@]2(O)C(=O)CO,其预测抗病毒活性得分为 0.955。
  • 结果表明,潜在空间中自适应的、动态的环境构建能有效抑制无关变化,并在低数据量的分子性质预测中实现稳健的外推。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。