Skip to main content
QUICK REVIEW

[论文解读] Drug Discovery under Covariate Shift with Domain-Informed Prior Distributions over Functions

Leo Klarner, Tim G. J. Rudner|arXiv (Cornell University)|Jul 14, 2023
Computational Drug Discovery MethodsComputer Science被引用 3
一句话总结

本文提出 q-savi,一种概率深度学习框架,通过将药物样化学空间的领域特定先验知识编码为函数上的先验分布,从而在协变量偏移下提升药物发现性能。通过使用变分推断以情境感知先验正则化神经网络,q-savi 在分布外化学化合物上的预测准确率和不确定性校准方面,显著优于最先进的自监督和领域自适应方法。

ABSTRACT

Accelerating the discovery of novel and more effective therapeutics is an important pharmaceutical problem in which deep learning is playing an increasingly significant role. However, real-world drug discovery tasks are often characterized by a scarcity of labeled data and significant covariate shift$\unicode{x2013}\unicode{x2013}$a setting that poses a challenge to standard deep learning methods. In this paper, we present Q-SAVI, a probabilistic model able to address these challenges by encoding explicit prior knowledge of the data-generating process into a prior distribution over functions, presenting researchers with a transparent and probabilistically principled way to encode data-driven modeling preferences. Building on a novel, gold-standard bioactivity dataset that facilitates a meaningful comparison of models in an extrapolative regime, we explore different approaches to induce data shift and construct a challenging evaluation setup. We then demonstrate that using Q-SAVI to integrate contextualized prior knowledge of drug-like chemical space into the modeling process affords substantial gains in predictive accuracy and calibration, outperforming a broad range of state-of-the-art self-supervised pre-training and domain adaptation techniques.

研究动机与目标

  • 为解决早期药物发现中因标注数据稀缺而导致模型在分布外化合物上表现不佳的协变量偏移挑战。
  • 开发一种透明且基于概率原理的方法,将药物样化学空间的显式先验知识整合到深度学习模型中。
  • 构建一个稳健且可外推的评估设置,以真实模拟生物活性预测中的现实世界数据偏移。
  • 在强分布偏移条件下,超越现有的自监督预训练、领域自适应和集成方法,在预测性能和校准方面表现更优。
  • 为结构上迥异的新化合物提供可靠的不确定性量化,这对指导药物发现中的实验验证至关重要。

提出的方法

  • q-savi 通过从高质量、预处理过的生物活性数据集中提取的上下文点分布,定义了函数上的先验分布。
  • 它使用变分推断训练神经网络,同时以问题相关的先验正则化其假设空间,从而将领域知识有效嵌入模型的归纳偏置中。
  • 该方法从化学空间的代表性子集采样上下文点以构建先验,确保模型的预测受到已知构效关系的约束。
  • 先验通过分子量和谱聚类等领域特定统计量构建,以在训练-测试划分中诱导有意义的协变量和标签偏移。
  • 该框架通过建模反映数据不确定性与模型不确定性在分布偏移下的预测分布,支持不确定性量化。
  • 它通过允许研究人员显式指定理想的‘退出向量’用于化合物设计,实现主动学习和性质优化。

实验结果

研究问题

  • RQ1在低数据、分布外的药物发现场景中,显式编码药物样化学空间的领域先验知识是否能提升泛化能力?
  • RQ2q-savi 使用函数空间先验的方法与自监督预训练和领域自适应相比,在处理强协变量偏移和标签偏移时表现如何?
  • RQ3基于概率和先验的方法在可外推的化学空间中,能在多大程度上改善预测校准和不确定性估计?
  • RQ4基于分子统计量(如分子量、谱聚类)导出的情境感知先验,能否带来更稳健且更有意义的训练-测试划分用于评估?
  • RQ5通过变分推断整合先验知识是否能降低对新颖、结构差异较大的化合物预测中的过度自信风险?

主要发现

  • 在最严重的协变量和标签偏移数据集(HIVPROT、DPP4、NK1)上,q-savi 显著优于所有基线方法(包括自监督预训练、领域自适应和深度集成),且差异具有统计学显著性。
  • 在 HIVPROT 数据集上,q-savi 的平均 RMSE 为 0.682 ± 0.019,显著优于次优基线方法的 0.712 ± 0.014。
  • 在 DPP4 数据集上,q-savi 的 RMSE 为 0.664 ± 0.028,显著优于基线方法的 0.705 ± 0.015。
  • 在 NK1 数据集上,q-savi 的 RMSE 为 1.332 ± 0.017,优于次优方法的 1.393 ± 0.024。
  • q-savi 展现出更优的不确定性校准,在所有测试集上均表现出更低的预测不确定性校准误差,尤其在最分布外的场景中表现更优。
  • 即使在训练数据高度偏倚的情况下,该方法仍保持强劲性能,表明其对由分子量和基于谱聚类的划分所引发的分布偏移具有鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。