Skip to main content
QUICK REVIEW

[論文レビュー] Protein-ligand binding representation learning from fine-grained interactions

Shikun Feng, Minghao Li|arXiv (Cornell University)|Nov 9, 2023
Computational Drug Discovery Methods被引用数 4
ひとこと要約

本論文では、タンパク質のドッキング部位とリガンドから最終的な複合体構造を予測するTransformerベースの相互作用モジュールを用いて、タンパク質-リガンド結合をモデル化する自己教師あり学習フレームワーク、BindNetを提案する。原子間のペアワイズ距離マップ予測とマスクされたリガンド再構成という事前学習目的を導入することで、BindNetは微細な相互作用表現を学習し、アフィニティ予測、バーチャルスクリーニング、ドッキングの分野で最先端の性能を達成するとともに、分布外構造に対しても優れた一般化性能を示す。

ABSTRACT

The binding between proteins and ligands plays a crucial role in the realm of drug discovery. Previous deep learning approaches have shown promising results over traditional computationally intensive methods, but resulting in poor generalization due to limited supervised data. In this paper, we propose to learn protein-ligand binding representation in a self-supervised learning manner. Different from existing pre-training approaches which treat proteins and ligands individually, we emphasize to discern the intricate binding patterns from fine-grained interactions. Specifically, this self-supervised learning problem is formulated as a prediction of the conclusive binding complex structure given a pocket and ligand with a Transformer based interaction module, which naturally emulates the binding process. To ensure the representation of rich binding information, we introduce two pre-training tasks, i.e.~atomic pairwise distance map prediction and mask ligand reconstruction, which comprehensively model the fine-grained interactions from both structure and feature space. Extensive experiments have demonstrated the superiority of our method across various binding tasks, including protein-ligand affinity prediction, virtual screening and protein-ligand docking.

研究の動機と目的

  • タンパク質-リガンド結合における教師あり深層学習モデルの一般化能力の制限を、自己教師あり表現学習を活用することで解決すること。
  • 個々のタンパク質およびリガンドエンコーダーに焦点を当てた既存の事前学習手法の欠点を克服し、結合相互作用パターンに焦点を当てる。
  • アフィニティおよびポーズ予測に不可欠な微細なアトムレベルの相互作用を明示的にモデル化する表現学習フレームワークの開発。
  • 特定の複合体コンformationに依存しない相互作用に敏感な表現を学習することで、分布外設定におけるロバストネスを向上させること。
  • 統一的で相互作用に敏感な表現を用いて、アフィニティ予測、バーチャルスクリーニング、ドッキングといった多様な結合タスクへの転移学習を可能にすること。

提案手法

  • 複合体構造予測タスクとして自己教師あり事前学習を定式化:タンパク質のドッキング部位とリガンドが与えられたもとで、最終的な結合複合体構造を予測する。
  • ドッキング部位とリガンド間の原子ペア相互作用に注目するTransformerベースの相互作用モジュールを採用し、固定されたタンパク質およびリガンドエンコーダーを用いる。
  • タンパク質とリガンドの原子間の微細な空間的相互作用パターンを監視するために、原子ペアワイズ距離マップ予測(ADP)を導入する。
  • 特徴空間内でリガンド表現をマスクして再構成することで、化学的特徴および3次元形状特徴を学習するためのマスクされたリガンド再構成(MLR)を提案する。
  • ADPとMLRの両方を用いたマルチタスク事前学習により、構造的および意味的相互作用知識を同時に最適化する。
  • 相互作用モジュールの再学習を伴わず、微調整によって学習済み表現を下流タスクに適用する。

実験結果

リサーチクエスチョン

  • RQ1結合プロセスを複合体構造予測としてモデル化する自己教師あり学習が、タンパク質-リガンド相互作用の表現品質を向上させ得るか?
  • RQ2微細な原子レベルの相互作用に焦点を当てた事前学習目的(ADPおよびMLR)は、個々の分子に焦点を当てたものよりも優れた下流性能をもたらすか?
  • RQ3BindNetで学習された相互作用に敏感な表現は、事前学習中に見られなかった分布外の複合体コンformationに対しても一般化可能か?
  • RQ4アフィニティ予測、バーチャルスクリーニング、ドッキングタスクにおいて、BindNetは教師ありおよび既存の事前学習手法と比較してどのように性能を発揮するか?
  • RQ5ADPおよびMLRの事前学習目的は、ロバストで包括的な結合表現を学習する上で、どの程度相補的に機能するか?

主な発見

  • BindNetは、すべてのインディストリビューションおよびアウトオブディストリビューション設定において、教師ありベースライン(Atom3D-CNN、Atom3D-GNN)および既存の事前学習手法(Uni-Mol)を上回るタンパク質-リガンドアフィニティ予測性能を達成した。
  • 分布外設定(RR:RDKitで生成されたコンformation)においても、BindNetは低RMSE(1.601)と高いAUPRC(0.78)を維持し、Atom3D-GNN(RMSE:12.475、AUPRC:0.42)およびUni-Mol(RMSE:2.15、AUPRC:0.72)を著しく上回った。
  • アブレーションスタディにより、ADPとMLRの事前学習を組み合わせることで最良の性能が得られ、それぞれが補完的な知識を提供することが確認された:ADPは空間的相互作用パターンを捉え、MLRは化学的および形状表現学習を強化した。
  • BindNetはバーチャルスクリーニングにおいても最先端の性能を発揮し、LBAではAUPRC 0.78、DUD-EではAUPRC 0.75を達成し、Uni-Molおよび教師ありモデルを上回った。
  • ドッキングタスクにおいても、特にCDおよびRR設定で、コンformationの変動に強く、優れた一般化性能を示した。
  • ADPとMLRのマルチタスク事前学習により、単一目的の事前学習に比べてAUPRCが15–20%向上し、相互作用に敏感な信号の共同最適化の有効性が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。