[論文レビュー] Meaningful machine learning models and machine-learned pharmacophores from fragment screening campaigns
本研究では、断片スクリーニングデータを用いて訓練された解釈可能な機械学習モデルを紹介しており、実験的に妥当化された「真のミス(true misses)」を組み込むことで予測精度を向上させ、化学的に意味のある相互作用パターンを特定するための帰属フレームワークを採用している。主な貢献は、モデルの予測を特定の薬効的特徴にマッピングする物理的に解釈可能な妥当化された手法であり、モデルの性能が最適でない場合でも、熟練した専門家によるアノテーションと強い一致を示している。
Machine learning (ML) is widely used in drug discovery to train models that predict protein-ligand binding. These models are of great value to medicinal chemists, in particular if they provide case-specific insight into the physical interactions that drive the binding process. In this study we derive ML models from over 50 fragment-screening campaigns to introduce two important elements that we believe are absent in most -- if not all -- ML studies of this type reported to date: First, alongside the observed hits we use to train our models, we incorporate true misses and show that these experimentally validated negative data are of significant importance to the quality of the derived models. Second, we provide a physically interpretable and verifiable representation of what the ML model considers important for successful binding. This representation is derived from a straightforward attribution procedure that explains the prediction in terms of the (inter-)action of chemical environments. Critically, we validate the attribution outcome on a large scale against prior annotations made independently by expert molecular modellers. We find good agreement between the key molecular substructures proposed by the ML model and those assigned manually, even when the model's performance in discriminating hits from misses is far from perfect. By projecting the attribution onto predefined interaction prototypes (pharmacophores), we show that ML allows us to formulate simple rules for what drives fragment binding against a target automatically from screening data.
研究の動機と目的
- タンパク質-リガンド結合予測の機械学習モデルにおいて、信頼性の高いネガティブデータの欠如を解消するため、断片スクリーニングキャンペーンから得た実験的に妥当化された「真のミス」を組み込むこと。
- ブラックボックスモデルを越えて、物理的に解釈可能で検証可能な結合予測の説明を提供する機械学習フレームワークの開発。
- 熟練した分子モデラーが行った独立した専門家アノテーションと照合することで、モデルの解釈可能性を検証すること。
- スクリーニングデータから直接、単純なルールベースの薬効的特徴モデルを導出し、ヒットからリードへの最適化における自動的インサイト生成を可能にすること。
- 帰属フィールドが、共有結合性または非共有結合性の結合モチーフに関する事前知識がなくても、結合に関連する化学的環境を正確に局在化できることを示すこと。
提案手法
- 本研究では、原子環境の類似性に基づくカーネル化された機械学習アプローチを用い、$G_{nl}Y_{lm}$記述子を用いてプローブ断片とトレーニングセット分子との間のペアワイズカーネル値を計算する。
- 帰属重みは、統合勾配の修正版を用いて計算され、$ z_a = \frac{1}{\text{norm}} \times \text{integral over } \alpha \text{ of } \partial Z_A / \partial k_{ab} $ で定義される。ここで $ k_{ab} $ は原子 a と b の類似性を測る。
- 局所化された帰属フィールド $ \varphi(\hat{z}) $ は、各原子中心の周囲の帰属重みをガウスカーネル(パrameter $ \alpha $)を用いて距離加重平均化することで定義され、重要な相互作用の空間的局在化を可能にする。
- ベースライン入力 $ x' $ を使用し、zスコア化された帰属重み $ \hat{z} $ を用いて、異なる分子環境間でフィールド表現を正規化・安定化する。
- フレームワークは、帰属結果を事前に定義された薬効的特徴プロトタイプに投影し、抽象的なモデル出力を解釈可能でルールベースの結合要因に関するインサイトに変換する。
- モデルの解釈可能性は、18の結合部位において熟練した分子モデラーが手作業でキュレートした薬効的特徴アノテーションと照合することで、厳密に検証されている。
実験結果
リサーチクエスチョン
- RQ1実験的に妥当化された「真のミス」をトレーニングデータに組み込むことで、断片スクリーニングデータを用いて訓練された機械学習モデルの性能と信頼性が顕著に向上するか?
- RQ2機械学習モデルがタンパク質-リガンド結合予測に対して、物理的に解釈可能で検証可能な説明をどの程度生成できるか?
- RQ3機械学習で得られた帰属フィールドは、専門家がアノテートした薬効的特徴と、どの程度一致して、主要な結合サブ構造を特定しているか?
- RQ4事前知識がなくとも、モデルの帰属メカニズムが、結合に関連する化学的環境を信頼性高く局在化できるか?
- RQ5モデルの出力をどの程度、スクリーニングデータから直接単純なルールベースの薬効的特徴モデルに変換できるか?
主な発見
- 実験的に妥当化された「真のミス」をトレーニングデータに組み込むことで、観察されたヒットのみで訓練されたモデルと比較して、得られる機械学習モデルの質と頑健性が顕著に向上した。
- 機械学習で得られた帰属フィールドは、結合に関連する特徴の空間的局在化を強く示しており、共有結合性阻害剤のSARS-CoV-2主要プロテアーゼにおいて、事前情報なしにアセチル基が主要な結合モチーフとして正しく同定されている。
- 非共有結合性断片ヒットでは、帰属フィールドが一意の主要な結合モチーフがないことと整合する広がりのあるパターンを示しており、このような場合のモデルの予測精度が低い理由が説明されている。
- モデルの帰属が特定する主要な分子サブ構造と、熟練した分子モデラーが手作業で割り当てたものとの間に強い一致が認められ、モデル分類性能が完璧でない場合でも同様である。
- 帰属フィールドを事前に定義された薬効的特徴プロトタイプに投影することで、断片結合のための単純で解釈可能なルールが得られ、スクリーニングデータから自動的に薬効的特徴仮説を生成することが可能になった。
- 帰属フィールドの標準偏差をブートストラップリサンプリングで計算することで、不確実性の信頼性ある測定が可能となり、モデルの解釈可能性に対する信頼性が向上した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。