Skip to main content
QUICK REVIEW

[論文レビュー] Pre-Training on Large-Scale Generated Docking Conformations with HelixDock to Unlock the Potential of Protein-ligand Structure Prediction Models

Lihang Liu, Shanzhuo Zhang|arXiv (Cornell University)|Oct 21, 2023
Computational Drug Discovery Methods被引用数 6
ひとこと要約

本論文では、物理ベースのツールで生成された1億個のタンパク質-リガンドドッキングコンformationを用いて事前学習した幾何学的注意を払ったSE(3)-同変な深層学習モデル、HelixDockを提案する。その後、限られた実験データで微調整した。この手法は、最先端のモデルと比較してRMSDで40%以上の向上を達成し、物理的知識を大規模な生成データに埋め込むことで、タンパク質-リガンド構造予測において優れた精度と頑健性を示した。

ABSTRACT

Protein-ligand structure prediction is an essential task in drug discovery, predicting the binding interactions between small molecules (ligands) and target proteins (receptors). Recent advances have incorporated deep learning techniques to improve the accuracy of protein-ligand structure prediction. Nevertheless, the experimental validation of docking conformations remains costly, it raises concerns regarding the generalizability of these deep learning-based methods due to the limited training data. In this work, we show that by pre-training on a large-scale docking conformation generated by traditional physics-based docking tools and then fine-tuning with a limited set of experimentally validated receptor-ligand complexes, we can obtain a protein-ligand structure prediction model with outstanding performance. Specifically, this process involved the generation of 100 million docking conformations for protein-ligand pairings, an endeavor consuming roughly 1 million CPU core days. The proposed model, HelixDock, aims to acquire the physical knowledge encapsulated by the physics-based docking tools during the pre-training phase. HelixDock has been rigorously benchmarked against both physics-based and deep learning-based baselines, demonstrating its exceptional precision and robust transferability in predicting binding confirmation. In addition, our investigation reveals the scaling laws governing pre-trained protein-ligand structure prediction models, indicating a consistent enhancement in performance with increases in model parameters and the volume of pre-training data. Moreover, we applied HelixDock to several drug discovery-related tasks to validate its practical utility. HelixDock demonstrates outstanding capabilities on both cross-docking and structure-based virtual screening benchmarks.

研究の動機と目的

  • 深層学習ベースのタンパク質-リガンド構造予測モデルのデータ不足と一般化性能の限界を解決すること。
  • 従来のツールで生成された大規模で物理的に妥当なドッキングコンformationを用いた事前学習により、予測精度を向上させること。
  • 事前学習済みタンパク質-リガンド構造予測モデルのスケーリング則を調査すること。
  • 特にSARS-CoV-2関連のものも含む、挑戦的で新しいタンパク質-リガンド複合体におけるモデルの頑健性を向上させること。
  • 物理ベースのコンformation生成と深層学習を組み合わせることで、AI駆動のドラッグディスcoveryの実現可能性と優位性を示すこと。

提案手法

  • 物理ベースのドッキングツールを用いて生成された1億個のタンパク質-リガンドドッキングコンformationを用いて、SE(3)-同変ニューラルネットワークを事前学習する。
  • 力場やスコアリング関数からの物理的知識を埋め込むために、大規模かつ多様な生成コンformationデータセットを活用する。
  • 実験的に検証済みの受容体-リガンド複合体の限定的なセットを用いて、事前学習モデルを微調整し、実際の結合ジオメトリに適応させる。
  • 構造アライメント戦略とインタラクションフィンガープrint類似度を用いて、モデルの一般化性能とテストセットの多様性を評価する。
  • fpocketを用いてポケット体積を計算し、PLECフィンガープrint上でタニモト類似度を算出することで、トレーニングデータとの構造的および化学的類似度を評価する。
  • PDBBindおよびPDB-COVID19データセット上で、物理ベースおよび深層学習ベースのベースラインと比較し、RMSD、アフィニティ予測、頑健性を評価する。

実験結果

リサーチクエスチョン

  • RQ1大規模で生成されたドッキングコンformationを用いた事前学習が、深層学習ベースのタンパク質-リガンド構造予測モデルの精度を顕著に向上させることができるか?
  • RQ2モデルサイズおよび事前学習データ量の増加に伴い、モデルの性能はどのように変化するか?
  • RQ3物理ベースで生成されたデータを用いた事前学習が、特に実験的データが限られた新しいタンパク質-リガンド複合体への一般化を向上させるか?
  • RQ4SARS-CoV-2関連タンパク質のような挑戦的ターゲットにおいて、本モデルは最先端手法と比較してどのように性能を発揮するか?
  • RQ5生成されたコンformationに埋め込まれた物理的知識が、下流の予測精度および頑健性に与える影響は何か?

主な発見

  • HelixDockは、標準ベンチマークデータセットにおいて、最も近い競合モデルと比較してRMSDで40%以上の向上を達成し、PDBBindコアセットでは2.06 ÅのRMSDを記録した。
  • PDB-COVID19データセットにおいても優れた性能を示し、11個の主要なSARS-CoV-2タンパク質ターゲットのうち10個でベースラインを上回った。
  • PDBBindコアセットでは、アフィニティ予測のRMSEが1.159、ピアソン相関係数Rが0.844を達成し、すべてのベースラインを上回った。
  • モデルサイズおよび事前学習データ量の増加に伴い、一貫した性能向上が見られ、タンパク質-リガンド構造予測におけるスケーリング則の妥当性が裏付けられた。
  • 生成データを用いた事前学習が一般化性能を顕著に向上させることを、多様で挑戦的なターゲット、特にトレーニングデータとは類似性の低いものでも確認した。
  • アブレーションスタディの結果、事前学習なしのHelixDockは性能が著しく低く(RMSE = 1.470)なったことから、大規模な生成コンformationを用いた事前学習の重要性が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。