Skip to main content
QUICK REVIEW

[論文レビュー] Lipophilicity Prediction with Multitask Learning and Molecular Substructures Representation

Nina Lukashina, Alisa Alenicheva|arXiv (Cornell University)|Nov 24, 2020
Computational Drug Discovery Methods参考文献 15被引用数 4
ひとこと要約

本稿では、分子部分構造を一般化されたハイパーアトムとして符号化し、D-MPNNバックボーンと統合することで分配係数予測の性能を向上させるマルチタスクグラフニューラルネットワーク、StructGNNを提案する。本手法は、logPおよびlogD予測において最先端の性能を達成し、それぞれRMSEが0.425および0.537に達する。これは、OT-GNN や D-MPNN といった先行モデルを著しく上回り、特に対称分子において顕著な向上を示す。

ABSTRACT

Lipophilicity is one of the factors determining the permeability of the cell membrane to a drug molecule. Hence, accurate lipophilicity prediction is an essential step in the development of new drugs. In this paper, we introduce a novel approach to encoding additional graph information by extracting molecular substructures. By adding a set of generalized atomic features of these substructures to an established Direct Message Passing Neural Network (D-MPNN) we were able to achieve a new state-of-the-art result at the task of prediction of two main lipophilicity coefficients, namely logP and logD descriptors. We further improve our approach by employing a multitask approach to predict logP and logD values simultaneously. Additionally, we present a study of the model performance on symmetric and asymmetric molecules, that may yield insight for further research.

研究の動機と目的

  • ドラッグディスカバリにおける分配係数予測の精度を向上させるために、分子表現学習の向上を図ること。
  • GNNにおける局所的メッセージパッシングの限界を、部分構造符号化によるグローバルな機能的官能基情報の統合によって克服すること。
  • 分子性質予測における対称分子と非対称分子の間の性能格差を解明すること。
  • logPとlogDを同時に予測するためのマルチタスク学習の利点を調査すること。
  • 新規で解釈可能な部分構造表現を用いて、logPおよびlogD予測の新しい最先端のベンチマークを確立すること。

提案手法

  • モデルは二重エンコーダアーキテクチャを採用:局所的原子間メッセージパッシングのためのD-MPNNエンコーダと、グローバルな機能的官能基特徴のための部分構造エンコーダ。
  • 分子部分構造(環、アミン、酸、エステル、スルホンアミド)は、構成原子から導かれる一般化された特徴を持つハイパーアトムとして表現される。
  • 部分構造特徴には、原子種別数、形式的酸化数、芳香族性、混成状態、および原子質量の合計が含まれ、1層の全結合ネットワークで符号化される。
  • 最終的な分子埋め込みは、D-MPNNの出力と平均化された部分構造埋め込みを連結することで形成される。
  • バランスの取れたRMSE損失を用いるマルチタスク学習の目的関数が導入され、欠損しているlogPまたはlogD値に対しても対応可能で、両タスクを同時に最適化する。
  • モデルはRMSE損失で訓練され、17,603個の固有SMILESを含む統合データセット上で評価される。そのうち251個の分子がlogPおよびlogDの両方の値を持つ。

実験結果

リサーチクエスチョン

  • RQ1分子部分構造を一般化されたハイパーアトムとして符号化することで、GNNの分配係数予測性能が向上するか?
  • RQ2logPとlogDの予測にマルチタスク学習を適用することで、単一タスク学習に比べて一般化性能が向上し、性能が向上するか?
  • RQ3異なるモデルは、対称分子と非対称分子の両方でどのように性能を発揮するか?また、観察された性能格差の背後にはどのような要因があるか?
  • RQ4D-MPNNに部分構造レベルの特徴を統合することで、特に困難な分子パターンの予測誤差を低減できるか?
  • RQ5既存のモデルでは、対称分子のlogPおよびlogDの予測に顕著な性能格差が生じており、その格差は解消可能か?

主な発見

  • StructGNNは、logP予測において0.425 ± 0.005の新たな最先端RMSEを達成し、前回のSOTAであるOT-GNN(0.508 ± 0.016)およびD-MPNN(0.464 ± 0.002)を上回る。
  • logD予測では、RMSEが0.537 ± 0.008に達し、OT-GNN(0.735 ± 0.114)およびD-MPNN(0.601 ± 0.008)を上回る。
  • マルチタスク版のStructGNNはさらに性能を向上させ、logPではRMSEが0.425 ± 0.005、logDでは0.537 ± 0.008を達成し、決定係数R²はそれぞれ0.948および0.817を記録した。
  • すべてのモデル、包括して最高性能を示すStructGNNでさえも、対称分子では顕著に高い誤差を示し、logPのRMSEは0.671 ± 0.017、logDでは1.113 ± 0.147に達する。
  • マルチタスクアプローチにより、対称分子の誤差が低減され、StructGNN+マルチタスクは対称logPでRMSEが0.541 ± 0.005、対称logDで0.367 ± 0.113を達成し、より高いロバストネスを示した。
  • 本研究では、対称分子が依然として根本的な課題として残っており、このサブセットにおいて両記述子を一貫して優れた性能で予測できるモデルは存在せず、これは根本的なモデリングギャップを示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。