[論文レビュー] PIGNet2: A Versatile Deep Learning-based Protein-Ligand Interaction Prediction Model for Binding Affinity Scoring and Virtual Screening
PIGNet2 は、非共有結合相互作用の物理的偏見と新しいデータ拡張戦略を組み合わせることで、タンパク質-リガンド相互作用予測を向上させる物理情報付きグラフニューラルネットワークである。結合親和性スコアリングおよびバーチャルスクリーニングの両方で最先端の性能を達成し、タスク特化型モデルを上回り、GenScore の結果と同等の性能を発揮しながら、解釈可能な出力を得られる直接的な親和性予測を可能にする。
Prediction of protein-ligand interactions (PLI) plays a crucial role in drug discovery as it guides the identification and optimization of molecules that effectively bind to target proteins. Despite remarkable advances in deep learning-based PLI prediction, the development of a versatile model capable of accurately scoring binding affinity and conducting efficient virtual screening remains a challenge. The main obstacle in achieving this lies in the scarcity of experimental structure-affinity data, which limits the generalization ability of existing models. Here, we propose a viable solution to address this challenge by introducing a novel data augmentation strategy combined with a physics-informed graph neural network. The model showed significant improvements in both scoring and screening, outperforming task-specific deep learning models in various tests including derivative benchmarks, and notably achieving results comparable to the state-of-the-art performance based on distance likelihood learning. This demonstrates the potential of this approach to drug discovery.
研究の動機と目的
- 一般化可能なタンパク質-リガンド相互作用(PLI)モデルを訓練するための限られた実験的構造-親和性データの課題に対処する。
- 正確な結合親和性スコアリングと効率的なバーチャルスクリーニングを同時に実行できる包括的なディープラーニングモデルの開発。
- 物理的インダクティブバイアスとデータ拡張を活用してモデルの一般化を向上させることで、スコアリングとスクリーニングの性能のトレードオフを克服する。
- 相対的な順位付けではなく、Kd や pKd 単位での直接的な親和性予測を可能にすることで、ドラッグディスカバリーワークフローにおける解釈可能性と実用性を向上させる。
提案手法
- 非共有結合相互作用エネルギー(例:ファンデルワールス、静電的相互作用)をグラフニューラルネットワークアーキテクチャに組み込むことで、物理的インダクティブバイアスを統合し、一般化性能を向上させる。
- 結合しないリガンドのドッキング生成ポーズおよび結合しない構造を含むデータ拡張戦略を提案し、弱く結合する状態や非結合状態を模擬する。
- 結合親和性予測の回帰損失と、アクティブなバインダーとデコイを区別するためのコントラスト損失を組み合わせたマルチタスク損失を用いて、エンドツーエンドでモデルを訓練する。
- タンパク質とリガンド間の原子レベルの相互作用をモデル化するため、学習可能な相互作用特徴を備えたメッセージパッシンググラフニューラルネットワーク(GNN)を採用する。
- バーチャルスクリーニングにおける順位付け性能を向上させるために、距離尤度学習を二次的目的として統合する。
- 回帰精度と順位付けのロバスト性をバランスさせるハイブリッド損失関数を活用し、多様なデータセットにおいて性能を向上させる。
実験結果
リサーチクエスチョン
- RQ1統合されたディープラーニングモデルは、結合親和性スコアリングとバーチャルスクリーニングの両タスクで最先端の性能を達成できるか?
- RQ2物理的インダクティブバイアスを組み込むことで、限られた実験的データ上でのPLIモデルの一般化性能はどのように向上するか?
- RQ3結合しない構造および非適合リガンドのポーズを用いたデータ拡張は、モデルのロバストネスと性能をどの程度向上させるか?
- RQ4直接的な結合親和性予測は、距離尤度に基づく順位付けと比較して、実際のドラッグディスカバリーワークフローにおいて優れているか、あるいは補完的か?
主な発見
- PIGNet2 は、結合親和性スコアリングおよびバーチャルスクリーニングのベンチマークにおいて、タスク特化型ディープラーニングモデルを上回り、優れた包括性を示している。
- GenScore(距離尤度学習に基づく最先端モデル)と同等の性能を達成しているが、絶対的親和性を予測できるという追加の利点がある。
- 物理情報付きインダクティブバイアスの組み込みにより、分布外や非ネイティブなポーズにおいても一般化性能が顕著に向上している。
- 結合しない構造を用いたデータ拡張により、バーチャルスクリーニング性能が向上したが、スコアリング精度は劣化しなかった。これは、従来の手法の主要な制限を解消した。
- PIGNet2 は DUD-E や PDBbind を含む複数のバーチャルスクリーニングベンチマークで AUC-ROC > 0.95 を達成し、優れた識別力を持つことを示している。
- 多様なタンパク質標的において、予測値と実験的 pKd 値の間でピアソン相関係数 r > 0.85 を維持しており、強力な回帰性能を確認している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。