[论文解读] Deep Generative Model Driven Protein Folding Simulation
该论文提出了一种基于深度生成模型的自适应采样工作流,将卷积变分自编码器(CVAE)与全原子分子动力学(MD)模拟相结合,以在高性能计算平台上加速蛋白质折叠。通过使用CVAE从MD轨迹中识别出新的构象状态,该方法引导新模拟朝向生物学上相关的折叠路径进行,对Fs-肽和FSD-EY分别实现了1.6 Å和4.4 Å的RMSD值,证明了其相对于传统方法的可行性与性能提升。
Significant progress in computer hardware and software have enabled molecular dynamics (MD) simulations to model complex biological phenomena such as protein folding. However, enabling MD simulations to access biologically relevant timescales (e.g., beyond milliseconds) still remains challenging. These limitations include (1) quantifying which set of states have already been (sufficiently) sampled in an ensemble of MD runs, and (2) identifying novel states from which simulations can be initiated to sample rare events (e.g., sampling folding events). With the recent success of deep learning and artificial intelligence techniques in analyzing large datasets, we posit that these techniques can also be used to adaptively guide MD simulations to model such complex biological phenomena. Leveraging our recently developed unsupervised deep learning technique to cluster protein folding trajectories into partially folded intermediates, we build an iterative workflow that enables our generative model to be coupled with all-atom MD simulations to fold small protein systems on emerging high performance computing platforms. We demonstrate our approach in folding Fs-peptide and the $ββα$ (BBA) fold, FSD-EY. Our adaptive workflow enables us to achieve an overall root-mean squared deviation (RMSD) to the native state of 1.6$~Å$ and 4.4~$Å$ respectively for Fs-peptide and FSD-EY. We also highlight some emerging challenges in the context of designing scalable workflows when data intensive deep learning techniques are coupled to compute intensive MD simulations.
研究动机与目标
- 为解决分子动力学(MD)模拟中采样生物相关时间尺度的挑战,特别是稀有事件(如蛋白质折叠)的采样问题。
- 开发一种自适应工作流,利用无监督深度学习从MD轨迹中识别新的构象状态。
- 在高性能计算平台上将深度学习与全原子MD模拟相结合,以提高采样效率。
- 评估CVAE驱动的自适应工作流相较于传统MD和基于MSM方法的性能表现。
- 识别并解决在涉及异构工作负载和动态资源分配的混合深度学习-MD工作负载扩展过程中存在的基础设施挑战。
提出的方法
- 在从MD模拟轨迹中提取的接触图上训练卷积变分自编码器(CVAE),以学习蛋白质构象的低维、具有生物物理意义的潜在表征。
- CVAE将轨迹聚类为部分折叠的中间体,并基于潜在空间中的新颖性识别新状态,从而指导新模拟起始点的选择。
- 使用OpenMM执行全原子MD模拟,力场为Amberff99SB-ildn,采用隐式溶剂模型(GBSA),每50 ps保存一次帧。
- 建立反馈回路,通过CVAE对模拟数据的分析确定下一轮模拟的运行集合,优先选择尚未充分采样的构象空间区域。
- 工作流在NVIDIA DGX-2平台上执行,MD模拟与CVAE训练并行进行,以实现实时自适应引导。
- 使用MDAnalysis计算接触图(Cα原子间距离小于8 Å),并将结果以HDF5格式存储,作为CVAE的输入。
实验结果
研究问题
- RQ1像CVAE这样的深度生成模型是否可以无需预先标注,就从蛋白质折叠轨迹中识别出具有生物学意义的构象中间体?
- RQ2与标准MD或基于MSM的方法相比,CVAE驱动的自适应采样在加速收敛至天然蛋白质状态方面的有效性如何?
- RQ3在HPC平台上实时耦合深度学习推理与大规模、计算密集型MD模拟时,存在哪些计算与基础设施挑战?
- RQ4CVAE基工作流在采样效率方面的提升程度如何,以有效性能和收敛速度为衡量标准?
- RQ5在实时自适应工作流中,CVAE训练与推理的计算成本与MD模拟运行时间相比如何?
主要发现
- 基于CVAE的自适应采样工作流成功折叠了Fs-肽和FSD-EY蛋白质,分别实现了与天然状态1.6 Å和4.4 Å的均方根偏差(RMSD)值。
- 基于收敛至参考结构的表现,CVAE驱动方法的有效性能估计至少是传统“朴素”MD或基于MSM采样方法的20倍。
- CVAE模型训练与推理时间与MD模拟时间相当——每轮CVAE训练周期约对应1纳秒的MD进展,使得实时适应成为可能。
- 将深度学习与MD模拟集成引入了显著的工作负载平衡、资源管理与调度挑战,原因在于异构且并发的工作负载。
- CVAE模型训练的计算成本与MD模拟运行时间相当,表明该工作流在实时自适应引导方面具有计算可行性。
- 该方法证明了可利用无监督深度学习在无反应坐标先验知识的情况下,引导MD模拟朝向稀有事件(如蛋白质折叠)进行。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。