[論文レビュー] Topological fingerprints reveal protein-ligand binding mechanism
本稿では、タンパク質-リガンド複合体の主要な幾何学的および化学的特徴を捉えるために、要素別恒続ホモロジー(ESPH)とトポロジカルフィンガープrint(TFs)を導入し、機械学習と統合して結合親和定数を正確に予測する。提案されたトポロジーに基づくスコア関数(T-Score)は、ベンチマークデータセット上で中位ピアソン相関係数0.817およびRMSE 1.912 kcal/molを達成し、トポロジーの抽象化と生物学的特異性の両方を効果的にバランスさせることで、既存の手法を上回る性能を発揮した。
Protein-ligand binding is a fundamental biological process that is paramount to many other biological processes, such as signal transduction, metabolic pathways, enzyme construction, cell secretion, gene expression, etc. Accurate prediction of protein-ligand binding affinities is vital to rational drug design and the understanding of protein-ligand binding and binding induced function. Existing binding affinity prediction methods are inundated with geometric detail and involve excessively high dimensions, which undermines their predictive power for massive binding data. Topology provides an ultimate level of abstraction and thus incurs too much reduction in geometric information. Persistent homology embeds geometric information into topological invariants and bridges the gap between complex geometry and abstract topology. However, it over simplifies biological information. This work introduces element specific persistent homology (ESPH) to retain crucial biological information during topological simplification. The combination of ESPH and machine learning gives rise to one of the most efficient and powerful tools for revealing protein-ligand binding mechanism and for predicting binding affinities.
研究の動機と目的
- 過剰な幾何学的詳細のため、または生物学的特異性の喪失のため、既存のスコア関数がタンパク質-リガンド結合親和定数を予測する際に抱える限界を解消すること。
- 高次元の幾何学的モデルと抽象的なトポロジー的抽象化の間のギャップを埋めるために、マルチスケールの幾何学的情報をトポロジー不変量に埋め込むこと。
- 結合親和定数の正確な予測に不可欠な化学的および構造的情報を保持する、低次元で生物学的に意味のあるタンパク質-リガンド相互作用の表現を構築すること。
- 相互作用ネットワークと空間スケールのトポロジー的分析を通じて、タンパク質-リガンド結合の背後にある分子機構を解明すること。
- 恒続ホモロジーから導出されたトポロジカルフィンガープリントが、大規模なベンチマークデータセットにおいて、結合親和定数予測の性能を顕著に向上させることを実証すること。
提案手法
- 異なる化学的要素ごとに別々にトポロジー不変量(ベッチ数)を計算するために、要素別恒続ホモロジー(ESPH)が用いられ、トポロジー的抽象化の過程で要素固有の生物学的情報を保持する。
- マルチスケール相互作用をモデル化するために、相関関数に基づくフィルトレーション(ローレンツ関数および指数関数)が適用され、パラメータ(ν, τ)が有効な相互作用長スケールを調整する。
- バインニングされたバーコード表現(BBR)が導入され、スケール区間ごとのベッチ数をバインングすることで、機械学習に適したコン act な特徴に恒続ホモロジーのバーコードを変換する。
- インタラクティブ恒続ホモロジー(IPH)が、特にC–Cネットワークとそのトポロジー的持続性の記述に用いられる。
- T-Scoreモデルは、すべての重原子からのベッチ-0、ベッチ-1、ベッチ-2特徴、炭素特異的ESTFs、およびマルチスケール相関に基づくフィルトレーションを組み合わせて、低次元で予測可能な特徴セットを生成する。
- PDBBind v2007コアセット上で、500回のランダム交差検証を実施し、T-Scoreモデルの妥当性と一般化能力を評価する。
実験結果
リサーチクエスチョン
- RQ1恒続ホモロジーから導出されたトポロジー的不変量は、タンパク質-リガンド複合体において生物学的に関連する化学的情報を保持するようにどのように適合可能か?
- RQ2正確な結合親和定数予測のための、トポロジー的抽象化と幾何学的特異性の最適なバランスは何か?
- RQ3どの相互作用スケールとリジッド層(例:第一層または第二層)がタンパク質-リガンド結合親和定数の予測に最も予測可能か?
- RQ440 Åを超える長距離C–C相互作用は、結合親和定数予測にどの程度寄与するか?
- RQ5恒続ホモロジーから得られるトポロジカルフィンガープリントは、大規模な結合親和定数予測において、既存の物理的ベース、知識ベース、経験的スコア関数を上回ることができるか?
主な発見
- T-Scoreモデルは、PDBBind v2007コアセット上で中位ピアソン相関係数0.817およびRMSE 1.912 kcal/molを達成し、既存の手法を顕著に上回った。
- ローレンツ相関関数を用いたベッチ-0 ESTFsは(ν, τ) = (3, 2)でピアソン相関係数0.769を示し、指数関数を用いたκ = τ = 1の場合は0.782を達成した。
- (ν, τ) = (3, 0.5)、(3, 1)、(3, 2)の3つのベッチ-0 ESTFsを組み合わせることで相関係数が0.784に向上し、マルチスケール分析の利点が示された。
- τ ≈ 1.6および3.1における予測精度の振動的ピークは、リジッドの第一および第二協和殻が結合親和定数に果たす重要な役割を示している。
- タンパク質-リガンドC–C相互作用は第一および第二層で予測に顕著に寄与するが、3–5 τの間でその影響は低下する。
- 大きな長尺度(τ > 5)では、タンパク質-リガンドC–Cのベッチ-1およびベッチ-2特徴が、予測力が再び顕著に向上するという驚きの傾向を示し、結合部位から40 Å以上離れた場所でも長距離の疎水性効果が影響を及ぼすことが示唆された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。