[论文解读] CLIPZyme: Reaction-Conditioned Virtual Screening of Enzymes
CLIPZyme 学习反应表示与酶结构之间的对比对齐,以对给定反应的酶候选进行排序,在基于EC的筛选中表现更优,且与EC预测器结合时效果更佳。
Computational screening of naturally occurring proteins has the potential to identify efficient catalysts among the hundreds of millions of sequences that remain uncharacterized. Current experimental methods remain time, cost and labor intensive, limiting the number of enzymes they can reasonably screen. In this work, we propose a computational framework for in-silico enzyme screening. Through a contrastive objective, we train CLIPZyme to encode and align representations of enzyme structures and reaction pairs. With no standard computational baseline, we compare CLIPZyme to existing EC (enzyme commission) predictors applied to virtual enzyme screening and show improved performance in scenarios where limited information on the reaction is available (BEDROC$_{85}$ of 44.69%). Additionally, we evaluate combining EC predictors with CLIPZyme and show its generalization capacity on both unseen reactions and protein clusters.
研究动机与目标
- 推动在体外以外的可扩展的虚拟筛选,用于识别用于新反应的天然酶催化剂。
- 开发一个反应编码器和一个蛋白质编码器,可以通过CLIP风格的目标对齐,以预测活性来对酶进行排序。
- 在部分反应信息的情景下,评估与基于EC的预测器相比的性能。
- 评估对未知反应和蛋白质簇的泛化能力,包括萜烯合成酶和未注释的酶。
提出的方法
- 通过将反应物和产物图与伪过渡态图相结合进行编码,使用原子映射数据和 DMPNN 编码器;通过对 TS 图使用第二个 DMPNN 编码,得到一个反应嵌入。
- 利用 AlphaFold 预测结构的酶,使用一个 E(n)-等变图神经网络(EGNN)初始化为 ESM-2 序列嵈来产生蛋白质嵌入。
- 使用对比学习目标训练反应编码器和蛋白编码器,以最大化正确的反应-酶对的余弦相似度,最小化负样本的相似度。
- 在共享嵌入空间中表示酶和反应,以实现给定反应的酶的检索式排序(虚拟筛选)。
- 使用基于 EnzymeMap 的数据集,包含原子映射的反应和 AlphaFold 结构;基线包括 EC-prediction(CLEAN)以及 CLEAN 与 CLIPZyme 的组合以获得更高的排序。
- 使用 BEDROC(alpha=85)和富集因子进行评估,并在各种反应编码和蛋白表示之间进行比较。
实验结果
研究问题
- RQ1CLIPZyme 是否能够有效地利用反应和蛋白结构嵌入对给定反应催化的酶进行排序?
- RQ2反应表示的选择(基于结构与 SMILES/CGR)是否会影响虚拟筛选的性能?
- RQ3将 EC 预测与 CLIPZyme 相结合是否会在不同 EC 信息水平下改善筛选性能?
- RQ4CLIPZyme 对未知反应和与训练集差异较大的蛋白质(包括萜烯合成酶和未注释的酶)的泛化能力如何?
主要发现
- CLIPZyme 在 EnzymeMap 测试筛选中达到 BEDROC 85 的 44.69%,超过 EC-prediction 基线。
- 将 CLIPZyme 与 CLEAN(EC 预测器)结合,在各 EC 级别下持续提升检索性能(例如,级别1在整合来源时 BEDROC 85 从 0.96% 提高到 57.03%)。
- 基于伪过渡态的反应表示比基于语言的 SMILES 表示具有更强的性能(BEDROC 85 为 44.69%)。
- 利用结构的 EGNN 蛛蛋白编码在筛选任务中优于仅序列的基线(ESM-2)。
- 萜烯合成酶数据集显示稳健的性能(BEDROC 85 为 72.46%),而未注释的 EnzymeMap 反应仍可得到有意义的排序(BEDROC 85 为 42.94%)。
- 在排除与训练数据高度相似的蛋白质时,性能下降,凸显结构特征的重要性;但对前 top 候选仍保留排序效用。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。