[論文レビュー] Step Change Improvement in ADMET Prediction with PotentialNet Deep Featurization
本稿では、分子グラフから直接深層的な分子表現を学習するグラフ畳み込みニューラルネットワーク、PotentialNetを紹介する。このモデルは、ADMET特性予測において最先端の性能を達成している。固定されたフィンガープrint特徴量の代わりに、エンド・トゥ・エンドのグラフベース学習を採用することで、多様なADMETエンドポイントにおいて内挿と外挿の両方の精度が顕著に向上し、ペア記述子を用いた従来のランダムフォレストモデルと比較して平均R²が30%以上向上した。
The Absorption, Distribution, Metabolism, Elimination, and Toxicity (ADMET) properties of drug candidates are estimated to account for up to 50% of all clinical trial failures. Predicting ADMET properties has therefore been of great interest to the cheminformatics and medicinal chemistry communities in recent decades. Traditional cheminformatics approaches, whether the learner is a random forest or a deep neural network, leverage fixed fingerprint feature representations of molecules. In contrast, in this paper, we learn the features most relevant to each chemical task at hand by representing each molecule explicitly as a graph, where each node is an atom and each edge is a bond. By applying graph convolutions to this explicit molecular representation, we achieve, to our knowledge, unprecedented accuracy in prediction of ADMET properties. By challenging our methodology with rigorous cross-validation procedures and prospective analyses, we show that deep featurization better enables molecular predictors to not only interpolate but also extrapolate to new regions of chemical space.
研究の動機と目的
- ADMET関連の問題が薬物開発の失敗率を高める要因であることを踏まえ、これらの特性を計算的に予測する精度を向上させること。
- ECFPや原子ペアなどの固定された手作業で設計された分子記述子が特徴空間内での構造的関係を損なうという限界を克服すること。
- 分子グラフから直接タスク固有の分子表現を学習する深層学習フレームワークを構築すること。これにより、トポロジー的および化学的関係を保持する。
- 内挿と、特に外挿的領域への一般化性能が優れていることを実証すること。
- 訓練中に使用されなかった実世界のドラッグディスカバリーデータを用いた前向きテスト、厳密な交差検証、時系列分割を含む検証を実施すること。
提案手法
- 分子を、原子をノード、結合をエッジとする無向グラフとして表現し、$N_{atoms} \times f_{in}$ 次元の特徴量行列 $X$ と、$N_{atoms} \times N_{atoms}$ の隣接行列 $A$ を用いる。
- 隣接する原子からの特徴量を集約する $K$ 層のグラフ畳み込み層を適用し、分子構造の階層的表現を学習する。
- 各原子の特徴量をプーリングするグラフアグリゲート操作を用い、回帰または分類タスク用のグローバルな分子表現を生成する。
- 連続的ターゲットには平均二乗誤差(MSE)損失、分類タスクにはバイナリクロスエントロピー損失を用い、バックプロパゲーションによるエンド・トゥ・エンドの学習を実施する。
- 同じデータを用いて、固定されたペア記述子特徴量を用いた従来のモデル(例:ランダムフォレスト)と比較する。
- 標準的なk分割交差検証に加え、時系列分割、分子量分割、および訓練中に使用されなかったデータに対する前向きテストを複数のバリデーションスキームとして適用する。
実験結果
リサーチクエスチョン
- RQ1グラフ構造データから直接分子表現を学習する深層学習モデルは、固定されたフィンガープリントを用いた従来の化学情報学的モデルをADMET予測において上回ることができるか?
- RQ2グラフベースの特徴量抽出は、固定された記述子手法と比較して、未知の化学空間への外挿性能を向上させることができるか?
- RQ3PotentialNetの性能は、多様なADMETエンドポイントにおいて、ベースラインモデル(例:ペア記述子を用いたランダムフォレスト)と比較してどの程度優れているか?
- RQ4訓練時に使用されなかった、前向きな実世界のドラッグディスカバリーデータに対して、モデルはどの程度一般化できるか?
- RQ5モデルが学習した表現は、解釈可能であり、ADMET特性に影響を与える主要な構造的特徴を特定できるか?
主な発見
- PotentialNetは17のADMETエンドポイントで平均R²が0.579を達成したのに対し、ペア記述子を用いたランダムフォレストは0.503であった。相対的な改善率は14.7%であった。
- 2018年11月~2019年2月のデータに対する前向きテストでは、PotentialNetは高い性能(平均R² = 0.542)を維持し、ホールドアウトされた実世界の化合物においてもベースライン(R² = 0.478)を上回った。
- 特に困難なエンドポイント、例えばhERG阻害(R²が0.306から0.445に上昇)やPGP効果性(R²が0.349から0.468に上昇)において、モデルの改善が顕著に見られた。従来のモデルが苦戦していた領域で顕著な向上が確認された。
- 文献に掲載されたマクロサイクルデータでは、PotentialNetはlogDに対してR²が0.603を達成した。これに対してランダムフォレストは0.394であった。構造的に多様で複雑な分子に対しても、優れた一般化性能を示した。
- 解釈可能性解析により、モデルはマクロサイクルコアや特定のヘテロ原子パターンといった、予測に最も影響を与える主要な薬効フォーマの特徴を正しく同定していた。
- 時系列および分子量分割評価から、PotentialNetは訓練データをはるかに超えて一般化できることを確認した。特に従来のモデルが失敗する外挿的領域において顕著な優位性を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。