Skip to main content
QUICK REVIEW

[論文レビュー] FoldToken: Learning Protein Language via Vector Quantization and Beyond

Zhangyang Gao, Cheng Tan|arXiv (Cornell University)|Feb 4, 2024
Machine Learning in Bioinformatics被引用数 5
ひとこと要約

FoldToken は配列-構造のベクトル量子化によって離散的なタンパク質言語を学習し、GPT風モデル FoldGPT を用いた自己回帰の配列-構造生成とバックボーンインペインティングや抗体設計などの応用を可能にします。SoftCVQ を導入して再現と生成のバランスを取ります。

ABSTRACT

Is there a foreign language describing protein sequences and structures simultaneously? Protein structures, represented by continuous 3D points, have long posed a challenge due to the contrasting modeling paradigms of discrete sequences. We introduce extbf{FoldTokenizer} to represent protein sequence-structure as discrete symbols. This innovative approach involves projecting residue types and structures into a discrete space, guided by a reconstruction loss for information preservation. We refer to the learned discrete symbols as extbf{FoldToken}, and the sequence of FoldTokens serves as a new protein language, transforming the protein sequence-structure into a unified modality. We apply the created protein language on general backbone inpainting and antibody design tasks, building the first GPT-style model ( extbf{FoldGPT}) for sequence-structure co-generation with promising results. Key to our success is the substantial enhancement of the vector quantization module, Soft Conditional Vector Quantization ( extbf{SoftCVQ}).

研究の動機と目的

  • FoldTokenizer を用いてタンパク質配列と構造を統一された離散言語へ橋渡しする。
  • タンパク質言語設定における高品質な再構成と生成を支えるベクトル量子化の改善。
  • FoldGPT を用いてタンパク質配列-構造のGPT風自己回帰生成を実現する。
  • バックボーンインペインティングと抗体設計といった下流タスクを実証する。
  • 効果的な SoftCVQ の性能に寄与する要因を特定するための分析とアブレーションを提供する。

提案手法

  • トランスフォーマー ベースの FoldTokenizer を用いて、配列と構造を連続潜在表現へエンコードする。
  • 提案された3つの VQ 戦略(SoftVQ、SoftGVQ、SoftCVQ)を用いて潜在コードを離散的なタンパク質言語へ量子化し、全コードブックに対するソフトクエリを適用する。
  • 離散コードから復元して、配列と角度ベースの構造表現を再構成する。
  • 学習されたタンパク質言語上で動作する自己回帰モデルとして FoldGPT を訓練し、インペインティングと配列-構造の共生成を行う。

実験結果

リサーチクエスチョン

  • RQ1再構成損失を用いて、離散的なタンパク質言語が配列-構造情報を忠実に表現できるか?
  • RQ2ソフトベクトル量子化法(SoftVQ、SoftGVQ、SoftCVQ)は、 Vanilla および LFQ 法と比較して再構成と生成を改善しますか?
  • RQ3学習されたタンパク質言語を用いたバックボーンインペインティングと抗体設計において FoldGPT はどの程度の性能を示しますか?
  • RQ4VQ 法の性能を左右する要因(GM、SI、MC、IB、SGQ)は何であり、SoftCVQ は再構成と生成をどのようにバランスさせますか?

主な発見

  • SoftCVQ は強力な再構成と競争力のある生成を達成し、ベースラインの VQ 法を再構成指標で上回り、効果的な生成を可能にする。
  • SoftVQ、SoftGVQ、SoftCVQ は Vanilla および LFQ に対して、CATH4.3 テストセットで TMScore と再構成成功率を大幅に改善する。
  • FoldGPT はベースラインを上回る配列インペインティング結果を示し、角度ベースの手法より構造インペインティングの改善を示す。
  • 抗体設計において、FoldGPT は競争力のある性能を示し、設計タスクにおける学習済みタンパク質言語の価値を示す。
  • 二値 VQ-ID(SoftCVQ)での離散化は、収束と大規模コードブック空間での安定した学習にとって極めて重要である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。