Skip to main content
QUICK REVIEW

[論文レビュー] Accurate ADMET Prediction with XGBoost

Hao Tian, Rajas Ketkar|arXiv (Cornell University)|Apr 15, 2022
Computational Drug Discovery Methods被引用数 4
ひとこと要約

本論文では、アンサンブル化された分子フィンガープrintと記述子を用いたXGBoostベースのADMET予測を提示しており、Therapeutics Data Commons (TDC) ADMETベンチマークで最先端の性能を達成している。モデルは22のタスクのうち11つで1位を獲得し、21のタスクで上位3位以内に入った。結果は、https://ai-druglab.smu.edu/admet で公開されているADMETboostウェブサーバーから入手可能である。

ABSTRACT

The absorption, distribution, metabolism, excretion, and toxicity (ADMET) properties are important in drug discovery as they define efficacy and safety. In this work, we applied an ensemble of features, including fingerprints and descriptors, and a tree-based machine learning model, extreme gradient boosting, for accurate ADMET prediction. Our model performs well in the Therapeutics Data Commons ADMET benchmark group. For 22 tasks, our model is ranked first in 18 tasks and top 3 in 21 tasks. The trained machine learning models are integrated in ADMETboost, a web server that is publicly available at https://ai-druglab.smu.edu/admet.

研究の動機と目的

  • ドラッグディスカバリにおけるADMET特性を高精度に予測する機械学習モデルの開発を目的とする。
  • 異なるデータセットによる評価の不一致という課題に対処するため、統一されたTDCベンチマークを用いる。
  • フィンガープリントと記述子を含む多様な分子特徴を統合し、一貫性のある予測モデルを構築することを目的とする。
  • XGBoostのアンサンブル学習および特徴選択の能力を活用することで、既存手法を上回る予測性能を実現することを目的とする。
  • 訓練済みモデルを用いた迅速なADMET予測を提供する、公開可能なウェブサーバーの提供を目的とする。

提案手法

  • モデルは6つの特徴抽出器(MACCS、拡張接続性、Mol2Vec、PubChem、Mordred、RDKit)のアンサンブルを用いる。
  • 分子のSMILESが、これらの6つの特徴抽出器を用いて特徴ベクトルに変換され、構造的および物理化学的性質が捉えられる。
  • 正則化された目的関数を用いてXGBoostが訓練され、過学習を抑制する。
  • 目的関数は損失項と正則化項 Ω(f) = γT + (λ/2)Σω² の組み合わせであり、木の複雑さを制御する。
  • 性能最適化のため、ランダムグリッドサーチを用いた交差検証によるハイパーパramータチューニングが実施された。
  • 訓練済みモデルは、SMUのハイパフォーマンスコンピューティングリソースを活用してウェブサーバーにデプロイされた。

実験結果

リサーチクエスチョン

  • RQ1多様な分子フィンガープリントと記述子のアンサンブルは、ADMET予測精度を向上させることができるか?
  • RQ2標準化されたTDC ADMETベンチマークにおいて、XGBoostは他の機械学習モデルと比較してどのように性能を示すか?
  • RQ3どの分子特徴がADMET予測性能に最も寄与しているか?
  • RQ41つの統一モデルが、多様なADMETタスクにおいてトップクラスの性能を達成できるか?
  • RQ5Mordred記述子のみを用いた場合、全特徴を用いた場合と比較してXGBoostの性能はどのように変化するか?

主な発見

  • XGBoostモデルは、TDCベンチマークの22のADMETタスクのうち11つで最高順位を獲得した。
  • 22のタスクのうち21つで上位3位以内に入ったため、一貫した高い性能を示した。
  • すべてのADMETタスクにおいて、Mordred記述子が最も重要な特徴タイプであった。続くのはMol2Vecと循環的フィンガープリントであった。
  • Mordred記述子のみを用いた場合、3つのタスク(HIA、AqSol、PPBR)で全特徴モデルを上回ったが、代謝および排泄タスクでは性能が劣った。
  • https://ai-druglab.smu.edu/admet にホスティングされたウェブサーバーADMETboostは、2Dおよび3D分子構造を可視化した状態で、数秒で予測を提供する。
  • 本研究では、XGBoostが多様な分子特徴から効果的に学習し、優れたADMET予測を実現できることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。