[论文解读] DrugCLIP: Contrastive Protein-Molecule Representation Learning for Virtual Screening
DrugCLIP 提出了一种对比学习框架,将虚拟筛选重新定义为密集检索任务,利用无需显式结合亲和力标签训练的蛋白质-分子对嵌入。该方法在 DUD-E 和 LIT-PCBA 基准上实现了最先进的零样本性能,显著优于传统对接方法和监督学习方法,且推理时间大幅缩短,尤其在大规模场景下优势明显。
Virtual screening, which identifies potential drugs from vast compound databases to bind with a particular protein pocket, is a critical step in AI-assisted drug discovery. Traditional docking methods are highly time-consuming, and can only work with a restricted search library in real-life applications. Recent supervised learning approaches using scoring functions for binding-affinity prediction, although promising, have not yet surpassed docking methods due to their strong dependency on limited data with reliable binding-affinity labels. In this paper, we propose a novel contrastive learning framework, DrugCLIP, by reformulating virtual screening as a dense retrieval task and employing contrastive learning to align representations of binding protein pockets and molecules from a large quantity of pairwise data without explicit binding-affinity scores. We also introduce a biological-knowledge inspired data augmentation strategy to learn better protein-molecule representations. Extensive experiments show that DrugCLIP significantly outperforms traditional docking and supervised learning methods on diverse virtual screening benchmarks with highly reduced computation time, especially in zero-shot setting.
研究动机与目标
- 解决传统分子对接在大规模虚拟筛选中计算成本高、推理速度慢的问题。
- 克服依赖于标注结合亲和力数据的监督学习方法存在的数据稀缺与泛化能力差的问题。
- 将虚拟筛选重新构塑为密集检索问题,实现在百亿规模化合物库上的高效、可扩展筛选。
- 利用来自 BioLip 和 ChEMBL 的大规模未标注蛋白质-分子对进行预训练,以学习鲁棒的表征。
- 提出一种基于蛋白质同源性的生物启发式数据增强策略(HomoAug),以提升表征学习效果。
提出的方法
- 将虚拟筛选形式化为密集检索任务:给定一个蛋白质口袋作为查询,从大规模化合物库中检索最相似的分子。
- 使用对比学习分别训练蛋白质和分子的独立编码器,以最大化正样本(结合)对之间的相似性,同时最小化负样本对之间的相似性。
- 采用对比损失函数,对已知结合的蛋白质-分子对的表征进行对齐,无需显式结合亲和力评分。
- 引入 HomoAug,一种基于进化同源性的数据增强方法,通过生成合成蛋白质-分子对来提升泛化能力。
- 预先计算并离线存储分子嵌入,通过将查询蛋白质嵌入与预存的分子嵌入进行匹配,实现在线推理的快速响应。
- 在大规模筛选任务中,利用预训练模型(如 AlphaFold2)进行蛋白质结构预测,以及使用 Fpocket 进行口袋检测。
实验结果
研究问题
- RQ1在无显式结合亲和力标签的情况下,对比表征学习是否能在虚拟筛选中实现优于监督学习方法的性能?
- RQ2将虚拟筛选重新构塑为密集检索任务,是否能实现在百亿规模化合物库上的高效、高通量筛选?
- RQ3所提出的 HomoAug 数据增强策略在多大程度上提升了模型的泛化能力与零样本性能?
- RQ4DrugCLIP 在真实世界药物发现场景中,与商业对接工具(如 Glide)相比,性能提升的幅度如何?
- RQ5该模型是否可扩展至其他药物发现任务(如靶点钓取),即利用一个分子寻找潜在的蛋白质靶点?
主要发现
- DrugCLIP 在 DUD-E 和 LIT-PCBA 基准上实现了最先进的零样本性能,优于传统对接方法和监督学习基线模型。
- 在人类评估中,药理学专家在 80% 的案例中更偏好 DrugCLIP 推荐的前 10 名分子,而非 Glide 的结果。
- 该模型可在数分钟内对超过 5 亿个口袋-配体对进行排序,而使用主动学习辅助对接的估计计算量相当于 CPU 运行一年。
- DrugCLIP 成功识别出肾脏表达的嗅觉 GPCR 的潜在配体,包括 OR2T5 与 2-壬烯醛、OR2T11 与对甲酚的结合,而这些物质均为已知的尿毒症毒素。
- 对接构象验证确认了合理的相互作用,如疏水作用、氢键和 π–π 堆积作用,支持其生物学合理性。
- 该模型在靶点钓取任务中表现出强大的泛化能力,优于对接方法,在识别给定分子潜在靶点方面表现更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。