Skip to main content
QUICK REVIEW

[论文解读] Protein Sequence and Structure Co-Design with Equivariant Translation

Chence Shi, Chuanrui Wang|arXiv (Cornell University)|Oct 17, 2022
Machine Learning in Bioinformatics被引用 13
一句话总结

该论文提出 ProtSeed,一种利用联合序列-结构空间中的等变平移实现端到端蛋白质序列与结构协同设计的新方法。通过采用具备三角函数感知能力的编码器和旋转变换等变的解码器,ProtSeed 一次性更新所有残基,相较于基于采样的方法,其蛋白质设计的保真度高且推理速度快几个数量级,同时在多个任务上超越了当前最先进基线方法。

ABSTRACT

Proteins are macromolecules that perform essential functions in all living organisms. Designing novel proteins with specific structures and desired functions has been a long-standing challenge in the field of bioengineering. Existing approaches generate both protein sequence and structure using either autoregressive models or diffusion models, both of which suffer from high inference costs. In this paper, we propose a new approach capable of protein sequence and structure co-design, which iteratively translates both protein sequence and structure into the desired state from random initialization, based on context features given a priori. Our model consists of a trigonometry-aware encoder that reasons geometrical constraints and interactions from context features, and a roto-translation equivariant decoder that translates protein sequence and structure interdependently. Notably, all protein amino acids are updated in one shot in each translation step, which significantly accelerates the inference process. Experimental results across multiple tasks show that our model outperforms previous state-of-the-art baselines by a large margin, and is able to design proteins of high fidelity as regards both sequence and structure, with running time orders of magnitude less than sampling-based methods.

研究动机与目标

  • 解决现有蛋白质序列-结构协同设计方法中存在的高推理成本和有限的跨条件建模问题。
  • 实现基于上下文特征的端到端、迭代式蛋白质序列与结构向目标状态的平移。
  • 开发一种在设计过程中保持几何一致性与旋转、平移等变性的方法。
  • 与自回归或扩散模型相比,实现高保真度蛋白质生成并显著降低推理时间。
  • 展示生成新型蛋白质折叠结构与复合物的能力,超越现有拓扑结构。

提出的方法

  • ProtSeed 将蛋白质协同设计建模为在联合序列-结构空间中,由上下文特征引导的迭代平移过程。
  • 三角函数感知编码器从上下文特征(如抗原结构或二级结构注释)中推断几何约束和先验知识。
  • 旋转变换等变解码器利用不变表示和基变换操作,一次性更新序列与结构,以保持全局等变性。
  • 该模型采用基于局部坐标系的结构更新方式,并将其转换为全局坐标,确保对刚体变换的不变性。
  • 该框架实现了序列与结构之间的跨条件建模,最大化信息流动,提升设计保真度。
  • 该方法在 CATH 和 SAbDab 数据集上进行训练,并使用困惑度(PPL)和氨基酸恢复率(AAR)进行评估。

实验结果

研究问题

  • RQ1是否能够通过一次完成的迭代平移框架,在推理成本低于自回归或扩散模型的前提下,实现高保真度的蛋白质序列与结构协同设计?
  • RQ2该模型在蛋白质设计过程中是否能保持几何一致性与旋转、平移等变性?
  • RQ3ProtSeed 是否能够生成现有数据库中不存在的新颖蛋白质拓扑结构,包括自定义长度的环区、β-桶结构或跨膜复合物?
  • RQ4该模型在多样化设计任务(如抗原特异性 CDR 设计、上下文条件设计和固定骨架设计)中的表现如何?
  • RQ5与顺序生成相比,序列与结构之间的跨条件建模在多大程度上提升了设计保真度?

主要发现

  • 在 CATH 数据集上,ProtSeed 在困惑度和氨基酸恢复率方面均优于当前最先进方法,且在所有测试划分中均表现出竞争力或更优性能。
  • 该模型实现了高保真度蛋白质设计,其运行时间比基于采样的基线方法(如扩散模型或自回归模型)快几个数量级。
  • 在案例研究中,ProtSeed 成功设计出新型蛋白质拓扑结构,包括延长的环区、自定义尺寸的β-桶结构以及具有指定α-螺旋数量的跨膜复合物。
  • 使用生成序列时,设计蛋白质与 AlphaFold2 预测结果具有高度结构一致性,证实了其结构合理性。
  • 通过 FoldSeek 和 BLAST 进行数据库搜索,结果表明合成蛋白质在序列和结构上均与已知蛋白质差异显著,表明其具备真正的从头设计能力。
  • 该方法在多样化蛋白质设计任务中表现出强大的泛化能力,包括抗原特异性 CDR 设计和固定骨架序列设计。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。