Skip to main content
QUICK REVIEW

[論文レビュー] PSP: Million-level Protein Sequence Dataset for Protein Structure Prediction

Sirui Liu, Jun Zhang|arXiv (Cornell University)|Jun 24, 2022
Protein Structure and Dynamics被引用数 9
ひとこと要約

本稿では、タンパク質構造予測のための、初めてのオープンソースでミリオンレベルのタンパク質配列データセットであるPSPを紹介する。このデータセットには、57万件の真正構造配列と74万5千件の蒸留配列が含まれており、最先端のモデルをベンチマーク手順に従って訓練可能にし、CAMEOコンテストで51タンパク質の検証セットにおいて87.2のlDDTと90.1のTMスコアを達成するSOTA性能を発揮した。

ABSTRACT

Proteins are essential component of human life and their structures are important for function and mechanism analysis. Recent work has shown the potential of AI-driven methods for protein structure prediction. However, the development of new models is restricted by the lack of dataset and benchmark training procedure. To the best of our knowledge, the existing open source datasets are far less to satisfy the needs of modern protein sequence-structure related research. To solve this problem, we present the first million-level protein structure prediction dataset with high coverage and diversity, named as PSP. This dataset consists of 570k true structure sequences (10TB) and 745k complementary distillation sequences (15TB). We provide in addition the benchmark training procedure for SOTA protein structure prediction model on this dataset. We validate the utility of this dataset for training by participating CAMEO contest in which our model won the first place. We hope our PSP dataset together with the training benchmark can enable a broader community of AI/biology researchers for AI-driven protein related research.

研究の動機と目的

  • タンパク質構造予測におけるAIモデルの訓練に向け、大規模で多様性に富み、高品質なオープンソースデータセットの著しい不足に対処すること。
  • AlphaFold2のような最先端モデルのフルスケール訓練を支援する包括的でスケーラブルかつアクセス可能なデータセットを提供すること。
  • ハイパーパramータ、訓練コスト、段階的精度メトリクスを含む、詳細で再現可能なベンチマーク訓練手順を提供すること。
  • 訓練およびファインチューニングの過程で、新たな損失関数とデータサンプリング戦略を用いることで、モデル性能を向上させること。
  • データと訓練プロトコルを公開することで、コミュニティ全体が先端的なタンパク質構造予測ツールにアクセス可能になるようにすること。

提案手法

  • 57万件の真正構造配列と74万5千件の蒸留配列を含む大規模データセットの構築。高多様性と高品質性を実現。
  • 構造予測のための完全な入力特徴の統合:アミノ酸配列、MSA、テンプレート、およびAlphaFold2のatom37形式による原子レベル座標。
  • 2段階のデータ構成の採用:真正構造データセットと蒸留データセットのそれぞれを、効率的なストレージとアクセスを実現するための256個の圧縮パートに分割。
  • 詳細なハイパーパramータ、訓練コストの見積もり、各訓練段階での期待される精度を含む、ベンチマーク訓練パイプラインの開発。
  • モデルの汎化性能を向上させるために、初期訓練段階で構造関連損失と改善されたデータサンプリング戦略を統合。
  • ファインチューニング段階で安定化された違反損失を適用し、信頼性と構造的正確性を向上させた。

実験結果

リサーチクエスチョン

  • RQ1ミリオンレベルのタンパク質配列データセットは、最先端のタンパク質構造予測モデルの訓練と性能向上に顕著な効果をもたらすか?
  • RQ2詳細なハイパーパramータと段階的メトリクスを備えた包括的でオープンソースの訓練ベンチマークは、AI駆動のタンパク質研究における再現可能性とアクセス可能性をどの程度向上させるか?
  • RQ3高品質な蒸留配列と多様な真正構造の統合は、モデルの汎化性能と正確性にどのような影響を及ぼすか?
  • RQ4損失関数とデータサンプリング戦略の改善は、構造予測モデルの性能向上にどのような寄与をするか?
  • RQ5コミュニティがアクセス可能なデータセットと訓練手順は、CAMEOのような実世界のベンチマークで競争力のある性能を実現できるか?

主な発見

  • PSPデータセットには、57万件の真正構造配列(10TB)と74万5千件の蒸留配列(15TB)が含まれており、同種のデータセットとしては最大規模である。
  • ベンチマーク訓練手順により、ハイパーパramータ、訓練コスト、各段階での期待される精度を詳細に含む、SOTAモデルのフルスケール訓練が可能になった。
  • PSPで訓練されたモデルは、CAMEOの1か月分の検証セット(51配列)において、90.1のTMスコアと87.2のlDDTを達成し、AlphaFold2やRoseTTAFoldを上回った。
  • 新規構造関連損失と改善されたデータサンプリング戦略の適用により、初期訓練段階で明確な性能向上が確認された。
  • ファインチューニング段階で安定化された違反損失を用いることで、モデルの信頼性が向上し、構造的誤差が低減した。
  • データセットは256個の圧縮パートに分割されており、効率的なストレージとアクセスが可能で、標準的な構造予測パイプラインと完全に互換性がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。