[论文解读] Str2Str: A Score-based Framework for Zero-shot Protein Conformation Sampling
Str2Str 提出了一种基于分数的、结构到结构的翻译框架,用于零样本蛋白质构象采样,该框架利用通用晶体结构上的近似去噪分数匹配,实现了无需模拟数据的快速、可泛化的采样,同时保持了旋转变换等变性。该方法实现了最先进性能,其速度比长时间的分子动力学(MD)模拟快几个数量级,且在保持构象多样性方面表现优异。
The dynamic nature of proteins is crucial for determining their biological functions and properties, for which Monte Carlo (MC) and molecular dynamics (MD) simulations stand as predominant tools to study such phenomena. By utilizing empirically derived force fields, MC or MD simulations explore the conformational space through numerically evolving the system via Markov chain or Newtonian mechanics. However, the high-energy barrier of the force fields can hamper the exploration of both methods by the rare event, resulting in inadequately sampled ensemble without exhaustive running. Existing learning-based approaches perform direct sampling yet heavily rely on target-specific simulation data for training, which suffers from high data acquisition cost and poor generalizability. Inspired by simulated annealing, we propose Str2Str, a novel structure-to-structure translation framework capable of zero-shot conformation sampling with roto-translation equivariant property. Our method leverages an amortized denoising score matching objective trained on general crystal structures and has no reliance on simulation data during both training and inference. Experimental results across several benchmarking protein systems demonstrate that Str2Str outperforms previous state-of-the-art generative structure prediction models and can be orders of magnitude faster compared to long MD simulations. Our open-source implementation is available at https://github.com/lujiarui/Str2Str
研究动机与目标
- 为解决传统构象采样方法(如蒙特卡洛方法 MC 和分子动力学方法 MD)在高维空间中因高能垒和探索缓慢而带来的局限性。
- 克服现有基于学习的生成模型对数据的依赖性以及泛化能力差的问题,这些模型需要为每个系统专门提供模拟数据进行训练。
- 开发一种零样本框架,仅使用通用晶体结构即可对任意未见过的蛋白质采样出多样且物理上合理的构象。
- 通过旋转变换等变建模,确保全局旋转和平移下的结构不变性。
- 实现高效、近似化的采样,绕过昂贵的迭代模拟过程,同时近似采样出符合玻尔兹曼分布的构象。
提出的方法
- Str2Str 将构象采样建模为在构象空间中基于分数的扩散过程的结构到结构翻译任务。
- 其采用在通用 PDB 晶体结构上训练的近似去噪分数匹配(DSM)目标,避免在训练或推理过程中依赖模拟数据。
- 该方法采用受模拟退火启发的前向-后向去噪过程,其中先施加随机扰动,再通过基于分数的优化进行精炼。
- 该模型被设计为对全局旋转变换和平移保持等变性,确保采样出的构象彼此之间不为平凡的旋转或平移关系。
- 通过折叠模块(如 ESMFold)提供初始结构,随后由 Str2Str 翻译网络对结构进行精炼,以生成多样构象。
- 该框架直接从 PDB 数据中学习潜在的结构分布,从而实现对新蛋白质的零样本迁移,无需微调或模拟数据。
实验结果
研究问题
- RQ1仅在晶体结构上进行训练的基于分数的生成模型,能否在未见过的蛋白质上实现有效的零样本构象采样?
- RQ2Str2Str 在构象采样多样性与准确性方面,与最先进生成模型及长时间 MD 模拟相比表现如何?
- RQ3旋转变换等变性在多大程度上提升了采样构象的质量与多样性?
- RQ4仅在结构空间上进行近似分数匹配,是否能优于结合序列信息的条件建模方法?
- RQ5从通用 PDB 结构中学习是否能实现跨不同蛋白质系统的泛化,而无需针对特定系统进行微调?
主要发现
- Str2Str 在构象采样多样性与准确性方面显著优于以往最先进生成结构预测模型。
- 该方法的采样速度比长时间 MD 模拟快几个数量级,同时保持了相当的构象多样性。
- Str2Str 展现出强大的零样本泛化能力,在未见过的蛋白质上表现良好,且在训练或推理阶段无需其模拟数据。
- 旋转变换等变设计确保了采样构象之间不为平凡的变体,从而保持了结构完整性。
- 尽管未依赖力场或动力学模拟,该模型在采样玻尔兹曼系综方面与长时间 MD 模拟相比表现相当。
- 该框架表明,仅从 PDB 结构中学习即可有效建模蛋白质构象动力学,提示蛋白质间的结构模式可能编码了共享的动力学信息。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。