[论文解读] Generative AI for Controllable Protein Sequence Design: A Survey
本综述全面概述了用于可控制蛋白质序列设计的生成式人工智能,系统性地根据结构、功能及高层次目标等约束对任务进行分类。综述了关键的生成模型(包括 MSA VAE、ProtGPT2、ProGen2 和基于扩散的方法)及优化技术,强调其在实现端到端、约束感知的蛋白质设计中的作用,应用涵盖药物发现与酶工程。
The design of novel protein sequences with targeted functionalities underpins a central theme in protein engineering, impacting diverse fields such as drug discovery and enzymatic engineering. However, navigating this vast combinatorial search space remains a severe challenge due to time and financial constraints. This scenario is rapidly evolving as the transformative advancements in AI, particularly in the realm of generative models and optimization algorithms, have been propelling the protein design field towards an unprecedented revolution. In this survey, we systematically review recent advances in generative AI for controllable protein sequence design. To set the stage, we first outline the foundational tasks in protein sequence design in terms of the constraints involved and present key generative models and optimization algorithms. We then offer in-depth reviews of each design task and discuss the pertinent applications. Finally, we identify the unresolved challenges and highlight research opportunities that merit deeper exploration.
研究动机与目标
- 通过为不具备深厚领域专业知识的研究人员阐明可控制蛋白质序列设计,弥合机器学习与生物化学之间的鸿沟。
- 解决以往综述过于聚焦特定方法或任务(如从头设计)而忽略基于突变的优化的局限性。
- 基于约束类型(如结构、功能或高层次目标)系统化分类蛋白质序列设计任务。
- 识别数据稀缺、模型可解释性及评估稳健性方面的未解挑战,并突出尚未充分探索的研究机遇。
- 通过梳理当前进展并勾勒可控制蛋白质设计的未来发展方向路线图,激发跨学科合作。
提出的方法
- 根据中心法则,将蛋白质序列设计任务分为三个层级:结构到序列、功能到序列,以及高层次序列设计。
- 调研基础生成模型,包括 MSA VAE、ProteinGAN、ProtGPT2、ProGen2、xTrimoPGLM、RITA 和 EvoDiff,用于学习天然蛋白质序列的分布。
- 回顾条件生成模型与优化算法(如 StructTrans、StructG 和强化学习),以实现对期望结构与功能特性的控制。
- 分析非自回归框架(如 GFlowNet 和 SCHRÖDINGER 桥)作为自回归与基于扩散模型的有前景的替代方案。
- 将预训练语言模型(PLMs)与强化学习相结合,以微调序列以实现目标特性,同时保持生物学自然性。
- 提出需要开发任务特定、具有生物学意义的评估指标,以摆脱对基于分布的计算得分的依赖。

实验结果
研究问题
- RQ1如何根据生成式 AI 模型在蛋白质序列设计中所施加的约束,对其进行系统性分类?
- RQ2哪些关键的生成建模范式与优化策略能够实现不同蛋白质设计任务中的可控设计?
- RQ3为何当前蛋白质序列设计的评估协议缺乏生物学稳健性?如何改进?
- RQ4在数据可获得性、模型可解释性与基准测试方面,阻碍该领域进展的主要挑战是什么?
- RQ5如何利用预训练语言模型与强化学习来增强蛋白质序列生成的可控性与自然性?
主要发现
- ProGen2 和 EvoDiff 等生成模型在建模天然蛋白质序列分布方面表现出色,能够生成多样且合理的序列。
- 通过 StructTrans 和 StructG 等模型实现的条件生成,可实现精确的结构到序列映射,在逆折叠与结构约束遵循方面取得有前景的结果。
- 对预训练语言模型(PLMs)进行强化学习微调,在优化序列以实现目标功能的同时保持序列自然性方面展现出潜力。
- 尽管已有进展,当前评估指标仍主要基于分布,缺乏生物学相关性,凸显了开发任务特定、生物学基础的基准的迫切需求。
- 该领域尚缺乏全面且普遍接受的基准测试——尽管已建立 ProteinInvBench 用于逆折叠任务,但更广泛、更真实的基准亟需建立。
- 非自回归框架(如 GFlowNet 和 SCHRÖDINGER 桥)作为扩散模型的可行且尚未充分探索的替代方案,值得在蛋白质序列生成中进一步研究。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。