[论文解读] Proteina: Scaling Flow-based Protein Structure Generative Models
论文介绍了ourmodel,一种大规模基于流的蛋白质骨架生成器,条件化于分层折叠类别标签,在最长可达800个残基的骨架上实现了目前最先进的性能,并能够通过可扩展的训练数据以及新颖的条件/引导机制实现可设计且多样的结构。
Recently, diffusion- and flow-based generative models of protein structures have emerged as a powerful tool for de novo protein design. Here, we develop Proteina, a new large-scale flow-based protein backbone generator that utilizes hierarchical fold class labels for conditioning and relies on a tailored scalable transformer architecture with up to 5x as many parameters as previous models. To meaningfully quantify performance, we introduce a new set of metrics that directly measure the distributional similarity of generated proteins with reference sets, complementing existing metrics. We further explore scaling training data to millions of synthetic protein structures and explore improved training and sampling recipes adapted to protein backbone generation. This includes fine-tuning strategies like LoRA for protein backbones, new guidance methods like classifier-free guidance and autoguidance for protein backbones, and new adjusted training objectives. Proteina achieves state-of-the-art performance on de novo protein backbone design and produces diverse and designable proteins at unprecedented length, up to 800 residues. The hierarchical conditioning offers novel control, enabling high-level secondary-structure guidance as well as low-level fold-specific generation.
研究动机与目标
- 用受扩散/流量匹配启发的模型对蛋白质骨架生成进行规模扩展。
- 结合基于CATH的分层折叠类别条件,以实现对二级结构和折叠级别生成的可控性。
- 开发一种可扩展的变换器架构,能够处理长蛋白质骨架(最长800个残基)。
- 引入新的分布层级指标,量化生成蛋白质与参考分布的匹配程度(FPSD、fJSD、fS)。
- 展示数据量扩展至数千万个合成蛋白质结构,并探索微调/引导策略(LoRA、CFG、自引导)以提升设计性和可控性。
提出的方法
- 使用流量匹配来学习向量场v_t,将高斯噪声转化为蛋白质骨架的C_alpha坐标的真实分布。
- 以可学习的嵌入以及分层的dropout对分层折叠类别标签(C、A、T层次)进行条件化,实现无条件和条件生成(分类器无关引导与自引导)。
- 采用可扩展的非等变换变换器架构来处理残基与对表示,支持可选的三角层和QK归一化增强。
- 在采样阶段,从v_t推导出一个分数s_t来形成一个SDE,从而实现带有可调噪声尺度gamma的随机采样。
- 引入基于折叠类别预测器p_phi的三种概率度量(FPSD、fJSD、fS),用于评估生成结构与参考结构在分布上的相似性。
- 在两个数据集上进行训练:一个二阶Foldseek AFDB聚类集合(F_FS)和一个2100万条高质量AFDB子集(F_21M),实现多达约2100万结构和比以往工作规模大约35倍的数据扩展。
- 探索包括基于LoRA的微调、分距图辅助损失、自条件化、折叠类别条件dropout等训练策略。
实验结果
研究问题
- RQ1一个大规模非等变换流模型能否生成高质量、可设计的最长800残基蛋白质骨架?
- RQ2分层折叠类别条件是否能对二级结构含量和折叠级别特征提供可控的生成?
- RQ3将训练数据扩展到数千万个合成蛋白质结构对可设计性、多样性和与参考数据的分布相似性有何影响?
- RQ4蛋白质骨架生成的有效训练与采样配方(如LoRA、CFG、自引导、t采样)是什么?
- RQ5新的分布层级指标(FPSD、fJSD、fS)是否能在不同折叠类别之间有意义地量化生成结构与参考分布的一致性?
主要发现
- uModel ourmodel 在无条件及折叠类别条件生成中达到最先进的骨架生成性能,包括可达800残基的长链。
- u分层折叠类别条件实现对生成结构的新型控制,包括折叠特定的合成和β-片层含量的增强。
- u在多达2100万条高质量合成结构上进行训练是可行的,且比Foldseek AFDB子集规模扩大约35倍,提升了分布真实感。
- u新指标FPSD、fJSD和fS量化分布层级的相似性以及跨折叠类别的多样性/新颖性,补充现有的可设计性指标。
- u模型的变换器参数可超过4亿,并且在LoRA和引导策略(CFG与自引导)上进行有效微调,以获得可设计的输出。
- u采样可以通过ODE或SDE进行,带有可调噪声尺度gamma,影响可设计性与多样性之间的权衡。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。