[论文解读] How to Hallucinate Functional Proteins
该论文提出 BioSeqVAE,一种在全部已知蛋白质序列空间上训练的变分自编码器,可在无结构信息的情况下生成语法正确、可能折叠的蛋白质序列。该模型实现了功能蛋白质的无监督设计,并成功“幻觉”生成具有特定亚细胞定位和酶功能的蛋白质,其结果通过潜在空间分类和序列生成得到验证。
Here we present a novel approach to protein design and phenotypic inference using a generative model for protein sequences. BioSeqVAE, a variational autoencoder variant, can hallucinate syntactically valid protein sequences that are likely to fold and function. BioSeqVAE is trained on the entire known protein sequence space and learns to generate valid examples of protein sequences in an unsupervised manner. The model is validated by showing that its latent feature space is useful and that it accurately reconstructs sequences. Its usefulness is demonstrated with a selection of relevant downstream design tasks. This work is intended to serve as a computational first step towards a general purpose structure free protein design tool.
研究动机与目标
- 开发一种通用的、无需结构信息的蛋白质设计工具,仅基于序列数据生成功能性蛋白质序列。
- 实现无需先验结构知识的新型、语法正确蛋白质序列的无监督生成,这些序列可能折叠并具有功能。
- 证明生成模型的潜在特征空间可编码生物学上有意义的特性,如亚细胞定位和酶功能。
- 通过在潜在空间中同时优化多个表型特征,实现多属性蛋白质设计。
- 为合成生物学和代谢工程中对“幻觉”蛋白质的实验验证提供计算基础。
提出的方法
- BioSeqVAE 是一种变分自编码器(VAE)变体,通过无监督方式在全部已知蛋白质序列空间上进行训练。
- 该模型学习蛋白质序列的连续、解耦的潜在表征,以捕捉功能和结构语法。
- 利用潜在空间通过优化生成新序列,下游监督模型引导设计朝向期望表型。
- 通过在潜在特征上训练的分类器预测亚细胞定位和酶功能(例如氧化还原酶)。
- 通过在潜在空间中联合优化多个表型分类器,实现多属性设计。
- 通过与 UniProt 的 BLAST 比对,对生成的序列进行验证,以评估其与已知功能性蛋白质的同源性。
实验结果
研究问题
- RQ1在全部已知蛋白质序列空间上训练的生成模型能否产生新颖、语法正确、可能折叠并具有功能的蛋白质序列?
- RQ2此类模型的潜在空间能否编码生物学上有意义的表型特性,如亚细胞定位?
- RQ3该模型能否同时生成具有多个期望表型特征的蛋白质,例如膜定位和氧化还原酶活性?
- RQ4“幻觉”生成的序列是否与已知功能性蛋白质具有同源性,表明其潜在功能?
- RQ5该方法在多大程度上可作为通用的、无需结构信息的蛋白质设计工具?
主要发现
- BioSeqVAE 成功以高保真度重建蛋白质序列,表明模型学习到了有意义的序列表征。
- 潜在空间可实现亚细胞定位的准确预测,对“幻觉”生成的核蛋白预测置信度达 76%,对膜蛋白为 54%。
- 该模型生成了一种具有功能的膜蛋白氧化还原酶,其与已知 ABC 转运蛋白亚基及 *Chara braunii* 的跨膜蛋白具有同源性。
- 该模型可生成长达 1000 个氨基酸的序列,超过任何先前基于机器学习的蛋白质生成模型。
- 潜在空间支持多属性设计,成功生成一种预测为同时具有膜定位和氧化还原酶活性的蛋白质。
- 该模型在无结构输入的情况下生成生物上合理的序列,表明其为通用的、无需结构信息的蛋白质设计提供了可行路径。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。