[論文レビュー] Proteina: Scaling Flow-based Protein Structure Generative Models
要約: 本論文は、階層的フォールドクラスラベルで条件付けられた大規模フロー型プロテインバックボーン生成モデル「ourmodel」を提案し、800残基までのバックボーンで最先端性能を達成するとともに、設計可能で多様な構造を実現するスケーラブルな訓練データと新規の条件付け/ガイダンス機構を可能にします。
Recently, diffusion- and flow-based generative models of protein structures have emerged as a powerful tool for de novo protein design. Here, we develop Proteina, a new large-scale flow-based protein backbone generator that utilizes hierarchical fold class labels for conditioning and relies on a tailored scalable transformer architecture with up to 5x as many parameters as previous models. To meaningfully quantify performance, we introduce a new set of metrics that directly measure the distributional similarity of generated proteins with reference sets, complementing existing metrics. We further explore scaling training data to millions of synthetic protein structures and explore improved training and sampling recipes adapted to protein backbone generation. This includes fine-tuning strategies like LoRA for protein backbones, new guidance methods like classifier-free guidance and autoguidance for protein backbones, and new adjusted training objectives. Proteina achieves state-of-the-art performance on de novo protein backbone design and produces diverse and designable proteins at unprecedented length, up to 800 residues. The hierarchical conditioning offers novel control, enabling high-level secondary-structure guidance as well as low-level fold-specific generation.
研究の動機と目的
- Diffusion/flow matchingに触発されたフローベースのモデルでプロテインバックボーン生成をスケールさせる。
- 階層的フォールドクラス条件付け(CATHベース)を組み込み、二次構造とフォールドレベル生成の制御性を確保する。
- 長いプロテインバックボーン(最大800残基)を処理できるスケーラブルなトランスフォーマーアーキテクチャを開発する。
- 生成されたタンパク質が参照分布にどの程度適合するかを定量化する新しい分布レベル指標(FPSD、fJSD、fS)を導入する。
- データ規模を数千万の合成タンパク質構造に拡大し、LoRA、CFG、オートガイダンスなどのファインチューニング/guidance戦略を探索して設計性と制御性を向上させる。
提案手法
- ノイズを現実的なCα座標へ変換するベクトル場v_tを学習させるためにフローメッチングを用いる。
- 階層的フォールドクラスラベル(C、A、Tレベル)を学習可能な埋め込みと階層的ドロップアウトを用いて、無条件・条件付き生成(分類子なしガイダンスおよびオートガイダンス)を実現する。
- モジュールを.residueとペア表現を処理するスケーラブルな非等価性トランスフォーマーアーキテクチャを採用し、三角層やQK正規化強化を任意で組み込む。
- サンプリング時にはv_tからスコアs_tを導出してSDEを形成し、ノイズスケールgammaを調整可能な確率的サンプリングを実現する。
- 生成と参照構造間の分布的類似性を評価するために、フォールドクラス予測器p_phiに基づく3つの確率的指標(FPSD、fJSD、fS)を導入する。
- 2つのデータセットで訓練する:2次 Foldseek AFDBクラスタリング集合(F_FS)と21Mの高品質AFDBサブセット(F_21M)で、約21M構造まで、以前の研究比で約35xのデータ規模を可能にする。
- LoRAベースのファインチューニング、ディストログラム補助損失、自己条件付け、フォールドクラス条件付けドロップアウトなどの訓練戦略を探索する。
実験結果
リサーチクエスチョン
- RQ1大規模で非等価性のあるフローモデルは、800残基までの高品質で設計可能なプロテインバックボーンを生成できるか。
- RQ2階層的フォールドクラス条件付けは、二次構造含有量およびフォールドレベルの特徴を制御可能な生成を提供するか。
- RQ3訓練データを数千万の合成タンパク質構造に拡大することは、設計性・多様性・参照データへの分布的類似性にどのような影響を与えるか。
- RQ4LoRA、CFG、オートガイダンス、t-サンプリングなど、タンパク質バックボーン生成の効果的な訓練とサンプリングのレシピは何か。
- RQ5新しい分布レベル指標(FPSD、fJSD、fS)は、フォールドクラス間で生成構造が参照分布とどの程度一致するかを意味ある形で定量化できるか。
主な発見
- uModel ϑourmodelは、条件なしおよびフォールドクラス条件付けバックボーン生成において最先端の性能を達成しており、800残基までの長鎖も含む。
- u階層的フォールドクラス条件付けは、生成された構造に新たな制御を可能にし、フォールド特有の合成とβシート含有量の強化を含む。
- u最大2100万の高品質合成構造での訓練は実現可能で、分布的現実味を向上させる。
- u新しい指標FPSD、fJSD、fSは分布レベルの類似性と多様性/新規性をフォールドクラス横断で定量化し、既存の設計性指標を補完する。
- uトランスフォーマーのパラメータ数は4億超へ拡張可能で、LoRAとCFG/オートガイダンスによる設計可能な出力のファインチューニングが有効であることを示す。
- uサンプリングはODEまたはSDEを介して行われ、設計性/多様性のトレードオフを調整するノイズスケールgammaを用いて実行できる。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。