[论文解读] Embracing assay heterogeneity with neural processes for markedly improved bioactivity predictions
该论文提出 MetaBind,一种基于神经过程的元学习框架,用于建模生物活性数据中的检测异质性,从而在多种蛋白质靶点和检测类型之间实现高精度且可适应的亲和力预测。通过从稀疏、异质的数据中学习,并利用特定任务的支持集,MetaBind 在误差率显著低于传统模型的情况下,实现了最先进的性能。
Predicting the bioactivity of a ligand is one of the hardest and most important challenges in computer-aided drug discovery. Despite years of data collection and curation efforts by research organizations worldwide, bioactivity data remains sparse and heterogeneous, thus hampering efforts to build predictive models that are accurate, transferable and robust. The intrinsic variability of the experimental data is further compounded by data aggregation practices that neglect heterogeneity to overcome sparsity. Here we discuss the limitations of these practices and present a hierarchical meta-learning framework that exploits the information synergy across disparate assays by successfully accounting for assay heterogeneity. We show that the model achieves a drastic improvement in affinity prediction across diverse protein targets and assay types compared to conventional baselines. It can quickly adapt to new target contexts using very few observations, thus enabling large-scale virtual screening in early-phase drug discovery.
研究动机与目标
- 为解决药物发现中稀疏且异质的生物活性数据带来的挑战,此类数据限制了现有预测模型的性能和可迁移性。
- 开发一种模型,能够在实验条件和检测类型存在差异的情况下,有效利用不同检测之间的信息协同效应。
- 仅通过少量观测到的活性测量值,实现对新靶点和检测的快速适应,支持大规模虚拟筛选。
- 通过显式建模检测层面的变异性而非将其视为噪声,提升配体亲和力预测的准确性和鲁棒性。
提出的方法
- 该模型采用分层元学习框架,将每个检测视为独立的学习任务,并将检测聚类为 K 个协方差簇,以建模共享的结构模式。
- 采用神经过程架构,为每个检测学习一个函数分布,条件基于少量观测到的配体-蛋白对及其测得的生物活性。
- 模型使用图卷积网络进行配体表征,使用卷积网络进行蛋白嵌入,并通过交叉协方差算子聚合跨任务的信息。
- 在训练过程中应用 Kullback-Leibler 散度损失,以鼓励模型从其观测的随机子集重建每个检测的完整协方差结构。
- 该框架在 ChEMBL 30 数据上端到端训练,筛选出高置信度、以人源靶点为目标的结合检测,终点包括 Ki、Kd、IC50 和 EC50。
- 通过任务级指标(T-RMSE、T-MAE)和成对检测划分评估模型,以检验其区分相同靶点但具有不同构效关系的实验异质性检测的能力。

实验结果
研究问题
- RQ1元学习模型能否有效捕捉并利用检测异质性,以提升在多样化蛋白质靶点上的生物活性预测性能?
- RQ2该模型在仅有极少标注数据的情况下,对新出现的、未见过的靶点和检测的泛化能力如何?
- RQ3该模型在多大程度上能够区分生物上相似但实验上异质的检测?
- RQ4与传统模型相比,考虑检测层面的变异性是否能显著提升预测准确性?
主要发现
- MetaBind 在测试集上实现了 0.48 pK 单位的任务级均方根误差(T-RMSE),相比传统基线模型有显著改进。
- 该模型展现出强大的零样本泛化能力,在 178 个未见过的靶点蛋白上实现了 0.36 pK 单位的 T-MAE,训练集与测试集之间配体相似性的中位数为 0.32。
- 在成对检测划分中,MetaBind 成功识别并建模了针对同一蛋白但表现出不同构效关系的检测之间的差异,表明其具有稳健的异质性处理能力。
- 该模型在包括生化检测和细胞检测在内的多种检测类型中,均优于标准深度学习和高斯过程基线模型。
- 使用 Kullback-Leibler 损失项可有效从部分观测集合中重建协方差结构,从而增强泛化能力和不确定性校准。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。