[论文解读] Fold2Seq: A Joint Sequence(1D)-Fold(3D) Embedding-based Generative Model for Protein Design
Fold2Seq 提出了一种基于 Transformer 的生成模型,联合学习蛋白质的一维序列嵌入与三维折叠嵌入,使用二级结构元件密度的体素化表示来表征折叠结构。该方法在序列和结构恢复任务中表现优异或相当,相较于最先进的方法(包括 RosettaDesign 和基于结构的模型),在低质量、不完整或模糊输入下展现出更优的覆盖范围与鲁棒性。
Designing novel protein sequences for a desired 3D topological fold is a fundamental yet nontrivial task in protein engineering. Challenges exist due to the complex sequence-fold relationship, as well as the difficulties to capture the diversity of the sequences (therefore structures and functions) within a fold. To overcome these challenges, we propose <b>Fold2Seq</b>, a novel transformer-based generative framework for designing protein sequences conditioned on a specific target fold. To model the complex sequence-structure relationship, Fold2Seq jointly learns a sequence embedding using a transformer and a fold embedding from the density of secondary structural elements in 3D voxels. On test sets with single, high-resolution and complete structure inputs for individual folds, our experiments demonstrate improved or comparable performance of Fold2Seq in terms of speed, coverage, and reliability for sequence design, when compared to existing state-of-the-art methods that include data-driven deep generative models and physics-based RosettaDesign. The unique advantages of fold-based Fold2Seq, in comparison to a structure-based deep model and RosettaDesign, become more evident on three additional real-world challenges originating from low-quality, incomplete, or ambiguous input structures. Source code and data are available at https://github.com/IBM/fold2seq.
研究动机与目标
- 为解决设计多样化、新颖蛋白质序列以折叠成目标三维拓扑结构(而非特定主链结构)的挑战。
- 克服现有折叠表示方法中手工设计、刚性或无法捕捉折叠内部结构多样性的局限。
- 通过在基于 Transformer 的自编码器框架中学习联合潜在空间,缓解序列与折叠嵌入之间的领域异质性问题。
- 在涉及不完整、低分辨率或模糊结构输入(如NMR集合)的实际场景中,提升模型的鲁棒性与泛化能力。
提出的方法
- 将蛋白质三维结构表示为二级结构元件(SSE)密度的三维体素网格,以无尺度、无规则的方式保留空间拓扑结构。
- 通过应用于体素化SSE密度的基于Transformer的编码器学习折叠表示,实现对折叠拓扑结构的端到端可微编码。
- 通过在域内与跨域对比损失联合训练序列-折叠自编码器,对齐序列空间与折叠空间中的潜在表示。
- 利用学习到的联合嵌入,通过基于Transformer的解码器生成以目标折叠为条件的蛋白质序列。
- 对多个NMR结构的体素特征进行平均,以生成单一、具有代表性的折叠嵌入,用于处理集合输入。
- 引入新型折叠级别评估指标,包括序列恢复率、结构恢复率与覆盖度,以评估设计的多样性与准确性。
实验结果
研究问题
- RQ1可学习的、基于体素的折叠表示是否能在保留结构拓扑的同时,实现对多样化折叠拓扑的鲁棒蛋白质序列生成?
- RQ2与分别学习序列与折叠表示的方法相比,联合序列-折叠嵌入学习在性能与泛化能力方面有何提升?
- RQ3Fold2Seq在低分辨率或不完整结构等实际挑战中,相较于基于结构的模型与基于物理的RosettaDesign,其性能提升程度如何?
- RQ4与基于结构的基线模型相比,Fold2Seq是否能更有效地利用NMR结构集合,以提升设计的多样性与准确性?
- RQ5联合学习框架是否能更全面地覆盖某一折叠内的序列空间,从而体现更高的设计新颖性与多样性?
主要发现
- 在高分辨率、完整的测试结构上,Fold2Seq在困惑度、序列恢复率与结构恢复率方面达到与最先进方法相当或更优的性能。
- 平均而言,Fold2Seq在ID测试集上的序列为0.89,OD测试集上为0.86,优于Graph_trans与RosettaDesign。
- Fold2Seq在折叠内部展现出更优的覆盖度,生成的序列多样性高于基线模型,表明设计新颖性得到提升。
- 在低分辨率结构上,Fold2Seq对结构退化表现出更低的敏感性,性能稳定;而Graph_trans则显著下降。
- 在存在缺失残基的结构中,当缺失率超过10%时,Fold2Seq的表现优于Graph_trans,t检验p值<1E-3,具有统计显著性。
- 在NMR集合中,Fold2Seq通过平均SSE密度实现的序列恢复率与覆盖度高于Graph_trans使用所有独立NMR模型的结果,表明其具备更优的可扩展性与效率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。