Skip to main content
QUICK REVIEW

[论文解读] VQPL: Vector Quantized Protein Language

Zhangyang Gao, Cheng Tan|arXiv (Cornell University)|Oct 8, 2023
Natural Language Processing TechniquesComputer Science被引用 3
一句话总结

该论文提出VQPL(向量量化蛋白质语言),一种通过向量量化变换器(VQProteinformer)将蛋白质序列与3D结构统一到离散潜在码空间的方法。通过量化器将残基类型和二面角映射为离散符号,该模型实现了联合序列-结构建模,在重建、预测和自回归生成任务中表现优异,软量化显著提升了结构重建的保真度。

ABSTRACT

Is there a foreign language describing protein sequences and structures simultaneously? Protein structures, represented by continuous 3D points, have long posed a challenge due to the contrasting modeling paradigms of discrete sequences. To represent protein sequence-structure as discrete symbols, we propose a VQProteinformer to project residue types and structures into a discrete space, supervised by a reconstruction loss to ensure information preservation. The sequential latent codes of residues introduce a new quantized protein language, transforming the protein sequence-structure into a unified modality. We demonstrate the potential of the created protein language on predictive and generative tasks, which may not only advance protein research but also establish a connection between the protein-related and NLP-related fields. The proposed method will be continually improved to unify more protein modalities, including text and point cloud.

研究动机与目标

  • 将蛋白质序列与3D结构统一到单一离散表示中,以实现联合建模。
  • 克服蛋白质建模中序列(NLP风格)与结构(GNN风格)表示之间的模态差异。
  • 实现融合自然语言处理与结构生物学的蛋白质表征学习。
  • 探索离散蛋白质语言在预测与生成蛋白质建模任务中的潜力。
  • 为未来整合文本、点云等额外模态奠定基础。

提出的方法

  • VQProteinformer使用基于Transformer的编码器,将受损的蛋白质序列和结构映射为连续潜在表征。
  • 向量量化器(VQ)将连续嵌入映射为离散潜在码,形成离散蛋白质语言。
  • 基于Transformer的解码器通过重建损失,从离散码中重建原始序列与结构。
  • 将蛋白质结构转换为二面角序列(r, α, β),以确保旋转与平移不变性,并支持序列建模。
  • 对序列和结构输入分别应用掩码与噪声污染,以提升表征学习效果。
  • 引入软量化,通过可微的软分配至码本,提升重建质量。

实验结果

研究问题

  • RQ1蛋白质序列与3D结构能否被有效统一到单一离散潜在空间?
  • RQ2离散蛋白质语言是否能支持基于Transformer的端到端建模,并达到或超越传统序列与结构模型的性能?
  • RQ3软量化与硬量化在保留结构与序列信息方面有何差异?
  • RQ4所学的离散蛋白质语言能否提升下游预测与生成任务的性能?
  • RQ5离散表征能否支持具有结构一致性的蛋白质序列自回归生成?

主要发现

  • 软量化器(Soft-2)在CATH4.3测试集上达到0.5786的TMScore,显著优于原始量化器(0.5592),证明了结构重建性能的提升。
  • 使用1024个码本的原始VQProteinformer(Vanilla-8)达到0.5743的TMScore,表明更大的码本可略微提升结构保真度。
  • VQProteinformer嵌入在8项基因本体与酶分类任务中的6项上略优于基线,BP任务F1得分为0.4380,折叠分类任务F1得分为0.8520。
  • 单阶段VQProteinformer(Vanilla-10)优于两阶段微调模型(Soft-2 → 新MLM编码器),表明联合预训练更具有效性。
  • 可视化结果表明,软量化VQProteinformer的重建结果在视觉上比原始模型更接近真实结构。
  • 使用离散蛋白质语言进行自回归填空生成了合理的结构片段,表明所学语言具备生成能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。